Três engenheiros colocaram três dos mais conhecidos modelos de inteligência artificial do mundo — o GPT, o Claude e o Grok — no comando de um automóvel de verdade, e o experimento terminou com apenas um deles capaz de dirigir. O teste, que uniu curiosidade técnica e uma dose considerável de ousadia, usou um Toyota Corolla comum e entregou aos modelos o controle direto do acelerador, dos freios e da direção do veículo.

A proposta era testar modelos de linguagem de grande escala, sigla LLM, sistemas de inteligência artificial treinados para entender e gerar texto, em uma tarefa para a qual eles não foram originalmente projetados: pilotar um carro físico no mundo real. Em vez de algoritmos dedicados à condução autônoma, como os usados por robôs-táxi comerciais, os engenheiros deram aos modelos instruções em texto sobre como operar os comandos do veículo e deixaram que a própria inteligência artificial decidisse, a cada instante, quanto acelerar, quando frear e para onde virar.

O resultado dividiu claramente os participantes. O ChatGPT, versão de consumo do GPT, foi o único modelo a completar a tarefa com sucesso, conseguindo manter o Corolla em movimento e sob controle durante o teste. O desempenho surpreendeu os próprios responsáveis pelo experimento, já que dirigir exige perceber o ambiente, reagir a imprevistos e tomar decisões contínuas em tempo real — habilidades muito distantes da tarefa original desses sistemas, que é processar e produzir linguagem.

ChatGPT pega a estrada, Grok bate na primeira: o teste ousado que colocou três inteligências artificiais ao volante de um carro de verdade - Imagem complementar

O Grok não teve a mesma sorte. O modelo perdeu o controle do carro quase imediatamente, terminando o teste em uma batida logo nos primeiros momentos ao volante. Já o Claude também não conseguiu concluir a condução com êxito, ficando ao lado do Grok entre os modelos que falharam na empreitada. Com isso, dos três sistemas colocados à prova, apenas um demonstrou capacidade real de operar o veículo.

O experimento expõe, na prática, a enorme distância que separa modelos de linguagem genéricos dos sistemas especializados em condução autônoma. Carros que dirigem sozinhos comercialmente dependem de sensores dedicados, mapas detalhados e software construído especificamente para a tarefa de pilotar, enquanto os modelos testados pelos engenheiros dependem basicamente de instruções textuais e de sua capacidade de raciocínio para interpretar cada situação.

PUBLICIDADE

Ainda assim, o fato de um modelo de linguagem ter conseguido dirigir um carro real, ainda que em condições controladas de teste, ilustra o avanço acelerado desses sistemas em tarefas cada vez mais distantes de sua função original. Ao mesmo tempo, a batida imediata do Grok e a falha do Claude servem como lembrete de que a habilidade de dirigir de forma segura exige muito mais do que a capacidade de entender comandos e gerar respostas coerentes. O episódio reforça a conclusão central do teste: por ora, apenas um dos três modelos de inteligência artificial colocados ao volante conseguiu, de fato, levar o carro adiante.