Añadir Mangas Verdes como fuente preferida de Google de forma gratuita.
Mantente informado con las últimas noticias de actualidad.
Conducir un coche real entre conos parece una prueba modesta hasta que quien va al volante no es una persona, sino un modelo generalista de inteligencia artificial.
DrivingBench llevó esa idea a un Toyota Corolla equipado solo con cámaras como sensores y puso a competir a GPT-6 Astra, Claude Fable 5.1, Grok 4.6 y GPT-5.6 Sol. El recorrido se hizo a muy baja velocidad y con una persona lista para pisar el freno de seguridad en cualquier momento.
Solo uno logró terminar un circuito que parecía sencillo
GPT-6 Astra fue el único capaz de completar el trazado y lo consiguió en su segundo intento. Recorrió 134,7 metros en cinco minutos y 22 segundos a 0,94 millas por hora, cerca de 1,5 kilómetros por hora.
Detrás quedó un paisaje bastante menos fino de lo que suele sugerir el discurso sobre estos sistemas.
Claude Fable 5.1 llegó aproximadamente a la mitad del circuito en su tercera prueba, pero en uno de sus ensayos pasó gran parte del tiempo procesando información y solo condujo 31 de los 190 segundos registrados. GPT-5.6 Sol apenas cubrió cerca del 6% del recorrido en sus tres intentos y su mejor marca fue de 17,1 metros. Grok 4.6 alcanzó 22,6 metros en su tentativa más eficaz, alrededor del 11% del trazado.
Una diagonal de conos bastó para romper la lectura del entorno
Ahí apareció una contradicción interesante. Modelos capaces de manejar lenguaje, código o imágenes tropezaron con algo tan físico como una línea diagonal de conos, que provocó fallos de percepción en casi todos los intentos que no lograron superar la primera curva.
Además, algunos sistemas ni siquiera aceptaron conducir al detectar que controlaban un vehículo físico. El equipo resolvió ese bloqueo con un ajuste verbal bastante revelador y añadió la palabra sandbox al nombre de uno de los componentes.
Ese detalle encaja con una vieja sospecha de la informática aplicada. A veces la máquina no falla por falta de potencia, sino porque interpreta la situación de un modo distinto al que esperan sus creadores.
La ventaja sigue en los sistemas hechos para conducir
Aditya Ramabadran, informático responsable de DrivingBench, no dejó mucho margen para la euforia.
"Usar hoy un modelo generalista avanzado para conducir definitivamente no resulta viable". - Aditya Ramabadran, informático responsable de DrivingBench
La frase importa porque llega después de una prueba real, no de una simulación ni de una comparación de laboratorio. También ayuda a entender por qué los sistemas específicos para conducción autónoma mantienen distancia frente a estos ensayos con modelos generalistas, algo que ya puede verse en servicios de taxi sin conductor operativos.
Waymo conserva esa ventaja tecnológica con servicios sin personal a bordo, mientras aquí la prueba dependía de un circuito acotado, una velocidad mínima y una supervisión humana permanente. La distancia entre ambas escenas no está en el coche, sino en la clase de inteligencia que toma decisiones sobre el asfalto.
Reducir el modelo quizá importe más que hacerlo más grande
Ramabadran plantea una salida distinta de la carrera por el modelo cada vez mayor. Su idea pasa por reducir modelos generalistas capaces hasta convertirlos en sistemas más pequeños que puedan ejecutarse dentro del propio vehículo, una dirección que conecta con el debate sobre modelos locales más ligeros.
DrivingBench, de hecho, pide cautela con sus propios resultados. Cada serie de intentos solo pudo evaluarse una vez y el equipo reconoce que necesita nuevas repeticiones y circuitos distintos para poder dibujar un panorama más amplio.
De momento, el dato más incómodo no es que solo uno terminara, sino cómo lo hizo. GPT-6 Astra necesitó cinco minutos y 22 segundos para recorrer 134,7 metros en un Corolla real entre conos, con una persona preparada para frenar en todo momento.