La inteligencia artificial se pone al volante: investigadores dejan conducir un coche real a ChatGPT y Grok para comprobar su comportamiento

Las cámaras instaladas para la prueba hicieron de ojos para cuatro modelos de inteligencia artificial, que recibían imágenes del recorrido mientras controlaban un Toyota Corolla entre conos. DrivingBench puso así a GPT-6 Astra, Claude Fable 5.1, Grok 4.6 y GPT-5.6 Sol ante una tarea para la que estos sistemas generalistas no habían sido concebidos específicamente.

DrivingBench prueba cuatro modelos al volante de un Toyota

El experimento de DrivingBench buscaba comprobar hasta dónde podía llegar un modelo generativo al gobernar un coche real mediante la información captada en el circuito. La prueba se desarrolló a velocidad muy baja y con una persona preparada para accionar el freno, unas condiciones que limitaban el riesgo mientras permitían observar cómo respondían los modelos fuera de sus usos habituales.

La mayor distancia llegó con GPT-6 Astra, que completó el trazado en su segundo intento y recorrió 134,7 metros en cinco minutos y 22 segundos. Según GB News, esa marcha equivalía a unas 0,94 millas por hora, cerca de 1,5 kilómetros por hora.

DrivingBench recoge que Astra fue el único modelo capaz de terminar, mientras Claude Fable 5.1 alcanzó aproximadamente la mitad en su tercera prueba y había igualado así el avance logrado por Astra en su primera salida.

El rendimiento de GPT-5.6 Sol quedó muy por debajo, con cerca del 6% del circuito completado en sus tres intentos y 17,1 metros recorridos en el tercero. Ese registro apenas mejoró en dos metros la primera prueba, pese a que después de cada salida los modelos recibían la petición de revisar sus errores. Grok 4.6 llegó a 22,6 metros en su mejor tentativa, alrededor del 11% del trazado, y tampoco consiguió superar el recorrido completo.

Algunos sistemas rechazaron inicialmente conducir el vehículo

Antes de comprobar cómo giraban, los investigadores tuvieron que conseguir que algunos sistemas aceptaran ponerse al volante, porque detectaban que estaban manejando un vehículo real que podía causar daños y rechazaban la tarea por motivos de seguridad.

DrivingBench señaló que GPT-6 Astra destacaba entre los modelos que se negaban incluso con el aparcamiento vacío, límites de velocidad reducidos y una persona preparada para intervenir. Presentar el ejercicio como una simulación tampoco resolvió siempre el problema, ya que las imágenes podían revelar al modelo que estaba ante un coche real. El equipo terminó añadiendo la palabra sandbox al nombre de uno de los componentes y consiguió así que los modelos condujeran de forma regular.

Una línea diagonal de conos concentró buena parte de los tropiezos, porque varios modelos no identificaban correctamente por qué lado discurría el carril antes de la primera curva. DrivingBench atribuyó ese fallo a la percepción del trazado, y los resultados muestran que casi todos los intentos que no llegaron a mitad del circuito quedaron detenidos antes de superar ese primer giro. Fable 5.1 también dedicó gran parte de una prueba a procesar información, pues solo estuvo conduciendo 31 de los 190 segundos registrados.

Ramabadran descarta actualmente el uso de modelos generalistas

Aditya Ramabadran, uno de los informáticos responsables de DrivingBench, situó el alcance del ensayo lejos de una aplicación habitual en declaraciones a The Register, donde señaló que usar hoy un modelo generalista avanzado para conducir “definitivamente no resulta viable”.

El investigador planteó otra vía para el futuro, basada en reducir modelos generalistas capaces y convertirlos en sistemas menores que puedan ejecutarse en el propio vehículo. DrivingBench reconoce además que cada serie de intentos solo pudo evaluarse una vez y que un estudio más amplio necesitaría nuevas repeticiones y circuitos diferentes.

Los sistemas creados específicamente para conducción autónoma conservan por ahora una ventaja frente a este tipo de experimentos con modelos generalistas, y Waymo ya opera servicios de taxi capaces de transportar pasajeros sin personal a bordo preparado para tomar el control.

El ensayo de DrivingBench, por lo tanto, deja una distancia amplia entre conseguir que un chatbot mueva un coche y disponer de una tecnología apta para circular en condiciones reales, con la seguridad y la evaluación todavía como límites principales del trabajo futuro.