Robôs humanoides prometidos como o futuro do trabalho ainda tropeçam na realidade dos laboratórios
O otimismo em torno dos robôs humanoides movidos por inteligência artificial convive com um abismo crescente entre as promessas públicas dos executivos do setor e os avanços modestos registrados nos laboratórios de pesquisa. A análise, publicada pelo MIT Technology Review em parceria com a fundação Aventine, mostra que, embora as técnicas por trás de assistentes como o ChatGPT estejam de fato ampliando as capacidades das máquinas, a chegada de generalistas capazes de automatizar quase todo o trabalho humano continua distante.
O caso mais emblemático é o Optimus, da Tesla, um robô humanoide branco com cabeça e tronco pretos que aparece em vídeos dançando, passando pipoca, aspirando o chão ou entregando garrafas de água em eventos da empresa. O diretor-executivo Elon Musk afirmou a acionistas, em julho, que o produto terá destreza humana e depois sobre-humana, e defende que cada unidade poderia custar apenas 20 mil dólares. No Fórum Econômico Mundial, em Davos, ele previu vendas ao público até o fim de 2027. Previsões parecidas vêm de Marc Andreessen, do fundo Andreessen Horowitz, que vê na robótica a maior indústria da história do planeta, e de Jensen Huang, da Nvidia, que apostou em igualdade com habilidades humanas já neste ano. O banco Morgan Stanley estima quase 1 bilhão de robôs humanoides até 2050, num mercado de mais de 5 trilhões de dólares.
Muitos pesquisadores, porém, recebem essas projeções com ceticismo. Yann LeCun, frequentemente citado como um dos padrinhos da inteligência artificial, afirmou em Davos que nenhuma das empresas que constroem humanoides sabe como torná-los inteligentes o suficiente para serem úteis. Ele também criticou a transferência direta dos métodos que funcionaram para linguagem, argumentando que eles não servem para os dados contínuos, ruidosos e de alta dimensão típicos da robótica. Jonathan Hurst, cofundador da Agility Robotics e professor na Universidade Estadual do Oregon, reforça a confusão comum entre forma e capacidade: é fácil construir uma máquina parecida com uma pessoa, mas é dramaticamente mais difícil fazê-la se mover e se comportar como uma.
Um dos sistemas mais avançados de hoje ilustra o estado real da arte. No Google DeepMind, um equipamento enxuto chamado ALOHA 2, composto por dois braços, garras e câmeras, serve de bancada de testes para o modelo Gemini Robotics. Esse sistema é um modelo de visão, linguagem e ação, conhecido pela sigla VLA, que combina entendimento de imagens e texto com comandos de movimento, treinado com demonstrações humanas feitas por teleoperação, técnica em que uma pessoa controla remotamente o robô. Controlado por esse modelo, o ALOHA 2 consegue montar uma marmita com pão, uvas e vasilhas lacradas, tarefas impensáveis três anos atrás. A limitação, contudo, é evidente: fora do conjunto de treino, a falha é quase certa.
O caminho mais difundido para ampliar essa generalidade é treinar os modelos com mais dados, mas não existe um oceano de demonstrações físicas comparável ao texto disponível para os modelos de linguagem. As alternativas atuais, como contratar pessoas para gerar teleoperação, usar vídeos humanos de baixa qualidade ou soltar robôs no mundo real, carregam custos, riscos ou deficiências técnicas. Hurst chama a premissa de fundamentalmente falha, já que até uma tarefa simples como preparar café envolve infinitas variações. A principal candidata a superação é o chamado modelo de mundo, uma inteligência treinada com vídeo, digitalizações tridimensionais e dados de sensores para prever consequências físicas das ações. A área atrai bilhões: a World Labs, cofundada por Fei-Fei Li, captou 1 bilhão de dólares e foi comprada pela AMD por 8,2 bilhões, enquanto a AMI Labs, de LeCun, também levantou 1 bilhão.
Um sinal do potencial apareceu na startup Physical Intelligence, em São Francisco, que desenvolve um cérebro universal para robôs. Sua linhagem de modelos avançou do π0, de 2024, treinado com 10 mil horas de demonstrações, até o π0.7, de abril de 2026, que incorpora um modelo de mundo leve e exibiu os primeiros sinais de generalização composicional, ou seja, a habilidade de recombinar capacidades aprendidas em tarefas nunca vistas, como colocar uma batata-doce numa fritadeira elétrica. O cofundador Sergey Levine, professor em Berkeley, comemorou o resultado como a primeira demonstração convincente desse tipo de generalização, embora a equipe tenha encontrado nos dados de treino fragmentos que podem explicar parcialmente o feito.
Enquanto isso, as demonstrações públicas frequentemente escondem que humanos controlam ou roteirizam os robôs, como ocorreu com a máquina que acompanhou Jensen Huang no palco em março de 2025. Marc Raibert, fundador da Boston Dynamics, resume o problema: uma taxa de sucesso de 70% equivale a não funcionar. Os humanoides já testados fora dos laboratórios, como os da Agility em centros da GXO Logistics, Amazon e Schaeffler, executam tarefas simples, como mover caixas. Musk admitiu em janeiro que apenas alguns Optimus fazem trabalhos básicos na fábrica. O robô doméstico 1X Neo, vendido por 20 mil dólares, ainda depende de operador remoto, e Hurst estima dez anos para máquinas úteis nas casas. A China lidera a produção, com quase 90% dos cerca de 15 mil humanoides embarcados em 2025, incluindo modelos da Unitree por menos de 6 mil dólares.
A reportagem lembra que o sonho não é novo, de Leonardo da Vinci e seu cavaleiro mecânico de 1495 ao Elektro da Westinghouse em 1939, ao WABOT-1 japonês de 1973 e ao ASIMO da Honda, descontinuado em 2018. Todos impressionaram, nenhum enfrentou o mundo real com sucesso. Com a inteligência artificial avançada, o desafio central permanece o mesmo, ainda que o progresso, agora mais consistente, aponte para uma revolução que os próprios roboticistas reconhecem como possível, mas sem data marcada.