Pesquisadores usaram o DrivingBench para pôr quatro modelos de IA ao volante de um Corolla com hardware da Comma e OpenPilot. No circuito de cones, cada IA teve três tentativas, mas parou várias vezes por falhas de percepção e controle.
Uma equipe formada por Aditya Ramabadran, Simon Mahns e Tobias Gessler desenvolveu o DrivingBench, plataforma que colocou quatro modelos de inteligência artificial geral diferentes no controle de um Toyota Corolla equipado com hardware de visão da Comma e com o sistema OpenPilot.
O experimento consistiu em um circuito curto, delimitado por pequenos cones e com algumas curvas. Todos os modelos receberam o mesmo protocolo de comandos e foram orientados a relatar o que estavam vendo e fazendo após cada etapa. Cada IA teve três chances para completar o circuito, mas precisou parar regularmente porque os comandos eram enviados aos servidores por meio de um ponto de acesso Wi‑Fi.
Dos dados apurados, ficou comprovado que os modelos ainda apresentaram dificuldades consideráveis ao volante. Das 11 tentativas realizadas, oito não passaram de 11% do trajeto e terminaram já na primeira curva. A dificuldade para calcular o ângulo de direção necessário em curvas foi um problema recorrente: em vários casos os modelos não esterçaram o suficiente para acompanhar o traçado definido pelos cones.
Em uma das primeiras tentativas, o modelo Grok interpretou o espaço entre os cones como um portão e seguiu em frente, parando após apenas dois comandos. Outro modelo da família GPT chegou a inventar uma regra — contrariando uma orientação explícita fornecida antes do início do teste — segundo a qual os cones de um dos lados tinham a mesma cor.
Apenas o GPT-6 Astra conseguiu completar o circuito, e o fez na sua segunda tentativa. Mesmo assim, a condução permaneceu longe da precisão necessária: o modelo realizou uma trajetória bastante tortuosa, contornou de forma exagerada uma longa curva à direita e quase saiu da pista pouco antes da linha de chegada.
O DrivingBench também registrou custos operacionais da execução. Após a volta completa, foi informado que a volta custou US$ 7,74, quase quatro vezes mais que a tentativa anterior, que chegou à metade do trajeto, além de consumir muito mais tokens.
O balanço do teste mostrou que, apesar do avanço dos modelos de IA em tarefas diversas, as soluções de propósito geral ainda careceram de consistência, percepção e controle refinado para assumir de forma segura e eficiente o controle de um carro em um circuito simples. As limitações observadas incluíram interpretação errônea do ambiente, decisões improvisadas em desacordo com instruções e controle de direção inadequado nas curvas.





