Pusieron a una IA al volante de un Toyota Corolla real; solo GPT‑6 Astra llegó hasta el final.

Pusieron a una IA al volante de un Toyota Corolla real; solo GPT‑6 Astra llegó hasta el final.

La carrera ganadora duró 5 minutos y 22 segundos y provocó la quema de 6,6 millones de tokens.

image

Por primera vez, un chatbot no estuvo junto al vehículo, sino dentro de su bucle de control. El equipo DrivingBench conectó cuatro modelos de IA general a un Toyota Corolla 2022 y les permitió a los modelos dirigir, acelerar y frenar en un aparcamiento señalizado con conos. La tarea parecía sencilla: seguir una ruta fija y detenerse en la zona señalada. Solo GPT-6 Astra de OpenAI completó la tarea por completo.

Los autores publicaron los resultados junto con el código, las indicaciones, los vídeos y las trazas de las carreras. Astra alcanzó el 49% de la ruta en el primer intento y luego analizó su propio error en el mismo diálogo. Entre intentos solo hubo la petición general de analizar el fallo. En la segunda carrera, el modelo cambió su manera de conducir, recorrió 134,7 m en 5 minutos y 22 segundos y envió 24 comandos al vehículo.

Tres rivales no completaron la ruta. Claude Fable 5.1 de Anthropic mejoró el resultado del 9% al 45% en tres intentos, Grok 4.6 de xAI se quedó en un máximo del 11%, y GPT-5.6 Sol mostró alrededor del 6% en tres ocasiones. La mayoría de las carreras fallidas terminaban en la primera curva, donde los modelos determinaban incorrectamente de qué lado de la hilera diagonal de conos pasaba el carril requerido.

«Estar al volante» en DrivingBench no significaba acceso directo del modelo a la mecánica del Corolla. El dispositivo comma four, a través de openpilot y del bus CAN, conectaba el coche con el portátil. Las cámaras y la telemetría se entregaban al modelo mediante herramientas MCP, y la respuesta indicaba la dirección, el porcentaje de giro del volante, la velocidad y la duración del movimiento. Cada comando nuevo reemplazaba al anterior, incluso si el anterior todavía se estaba ejecutando.

Este esquema convirtió la latencia de la respuesta en parte de la prueba. Mientras el modelo analizaba los fotogramas siguientes, el coche seguía ejecutando el último comando, por lo que una pausa larga podía llevar el vehículo hacia un cono. Astra observaba la situación aproximadamente cada 5–6 segundos y emitía alrededor de seis comandos por minuto. Algunos rivales, en cambio, dedicaban la mayor parte del tiempo a pensar con el coche detenido.

Una carrera exitosa requirió alrededor de 6,6 millones de tokens en solo 5 minutos y 22 segundos de movimiento. Las llamadas al modelo costaron apenas $7,74, ya que gran parte del contexto reenviado se facturó como entrada en caché. La primera carrera fallida necesitó aproximadamente 1,2 millones de tokens adicionales y costó $2,01.

La carrera ganadora seguía lejos de la conducción habitual. En el segundo intento, Astra no superó los 0,8 m/s y toda la pista llevó algo más de cinco minutos. En el habitáculo había constantemente un operador con el pie sobre el pedal del freno que podía intervenir si el coche salía de los límites o había riesgo de colisión. Las limitaciones del software reducían adicionalmente la velocidad y detenían el movimiento en caso de un exceso peligroso.

Las propias limitaciones de los chatbots resultaron ser un problema aparte. Los modelos se negaban periódicamente a controlar un coche real por razones de seguridad. Los autores más tarde contaron que Astra empezó a aceptar de forma estable solo después de una larga edición de la instrucción y de renombrar el entorno MCP a «DrivingBench Sandbox». Intentar describir lo ocurrido como una simulación funcionó peor.

La razón parecía casi cómica: las imágenes reales del aparcamiento permitían reconocer que el entorno no era virtual. La experiencia se desarrolló efectivamente en el mundo físico. El equipo usó un Corolla alquilado, buscó un recinto lo bastante vacío y abandonó los aparcamientos en dos ocasiones tras solicitudes para liberar el terreno. La empresa que alquiló el coche no conocía de antemano el propósito del alquiler.

Incluso la parte de software mostró los límites de los agentes actuales. Al inicio del proyecto, los desarrolladores pidieron a Astra que en un solo intento escribiera el software de enlace entre el modelo y el coche. Según el equipo, el resultado hubo que descartarlo y empezar de nuevo: la primera versión creció hasta unas 200 000 líneas. Más tarde, una infraestructura ya preparada permitió al modelo llevar el vehículo por toda la pista.

DrivingBench no demuestra la preparación de los modelos de lenguaje general para las vías públicas. Los autores realizaron una sola prueba por modelo, y los intentos repetidos se llevaron a cabo en un mismo contexto y por tanto no eran independientes. El experimento muestra un cambio más limitado: los modelos interactúan cada vez más con sistemas físicos con los que Astra, sin embargo, ya había trabajado en otras demostraciones.