IA aprende a detectar pelo cérebro do usuário quando entendeu errado sua intenção

Pesquisadores desenvolveram uma tecnologia capaz de identificar, por meio de sinais cerebrais, quando uma inteligência artificial interpretou incorretamente a intenção de uma pessoa. A proposta é permitir que sistemas de IA percebam uma espécie de "isso não era o que eu quis dizer" sem que o usuário precise verbalizar a correção. O trabalho foi conduzido pelo Korea Advanced Institute of Science and Technology (KAIST), em colaboração com o Microsoft Research Asia.

A tecnologia, chamada Neural Value Alignment (NVA), utiliza uma interface cérebro-computador, equipamento que conecta sinais neurais a máquinas, para analisar dados obtidos por eletroencefalografia (EEG) — exame que registra a atividade elétrica do cérebro — e fazer com que a IA ajuste seu comportamento em tempo real. O ponto de partida do estudo é um problema comum na interação entre pessoas e máquinas: uma mesma ação humana pode representar objetivos diferentes, enquanto um mesmo objetivo pode ser alcançado de várias maneiras.

IA lê o seu cérebro e descobre sozinha quando entendeu errado o que você queria - Imagem complementar

Os pesquisadores usam um exemplo simples para ilustrar essa ambiguidade. Uma pessoa pegar uma xícara não significa necessariamente que pretende beber nela: ela pode querer entregar o objeto a alguém, lavá-lo ou apenas mudá-lo de lugar. Da mesma forma, se o objetivo for matar a sede, a pessoa pode pegar uma xícara, buscar uma garrafa de água ou pedir que alguém leve uma bebida. Essa incerteza faz com que sistemas de IA possam interpretar corretamente uma ação, mas errar sobre o que a pessoa realmente queria — ou compreender o objetivo e escolher um caminho diferente do esperado pelo usuário.

Para contornar o problema, a equipe decidiu observar uma reação que ocorre no cérebro quando algo inesperado acontece. O cérebro humano faz previsões constantes sobre o que deverá acontecer e, quando o resultado não corresponde ao esperado, determinados sinais neurais podem aparecer. A pesquisa concentrou-se em dois deles: o erro de previsão de recompensa (RPE, na sigla em inglês) e o erro de previsão de estado (SPE, na sigla em inglês).

PUBLICIDADE

O RPE indica uma discrepância relacionada ao resultado ou ao objetivo. No sistema desenvolvido pelos pesquisadores, ele pode revelar que a IA não entendeu o que a pessoa realmente queria. Imagine que alguém peça a um robô doméstico algo para beber, queria água, mas receba café: o resultado está errado, e o cérebro pode produzir um sinal de RPE. Já o SPE funciona de maneira diferente, pois o objetivo está correto, mas o método utilizado pela IA não corresponde ao esperado. Se a pessoa quer água e o robô compreende isso, mas, em vez de pegar uma garrafa que está ao lado dela, vai até a cozinha e enche um copo na torneira, o objetivo foi alcançado por um caminho que não era o previsto — situação que pode gerar um SPE.

Durante os experimentos, os pesquisadores identificaram padrões diferentes nas ondas cerebrais quando ocorria um RPE, um SPE ou os dois simultaneamente. Em seguida, aplicaram técnicas de aprendizado profundo aos sinais captados pelo EEG, e o sistema conseguiu classificar a resposta da pessoa à atuação da IA. Na prática, a tecnologia distingue entre duas situações: "você entendeu meu objetivo errado" e "você entendeu o objetivo, mas fez do jeito errado". Os sinais decodificados servem então como retorno para o processo de decisão da máquina.

Quando identifica um SPE, o sistema interpreta que o objetivo está correto e que apenas a estratégia precisa ser modificada. Já um RPE indica que o próprio objetivo foi compreendido de maneira equivocada e que a IA precisa tentar novamente descobrir o que a pessoa pretendia. Segundo o KAIST, simulações mostraram que o método conseguiu se adaptar mais rapidamente do que abordagens existentes, mesmo em cenários de incerteza, como mudanças repentinas no objetivo de uma pessoa ou ausência de parte do retorno neural. O estudo foi publicado em agosto de 2026 na revista IEEE Transactions on Cybernetics, com o título Neural Value Alignment: Human–AI Collaboration Under Goal–Action Ambiguity.

Os pesquisadores veem possibilidades de aplicação em sistemas que precisam trabalhar próximos aos seres humanos. Um robô doméstico, por exemplo, poderia identificar, por meio da resposta cerebral do usuário, que interpretou uma instrução de forma incorreta e mudar seu comportamento sem esperar uma nova ordem verbal. A mesma abordagem poderia ser usada em robôs industriais, veículos autônomos que precisam responder ao julgamento do motorista, sistemas médicos e de reabilitação voltados a pessoas com dificuldades para falar ou se movimentar e ferramentas educacionais capazes de adaptar seu comportamento ao estado cognitivo do estudante.

Para Sang Wan Lee, professor do KAIST e responsável pela pesquisa, o trabalho demonstra que a IA pode ir além da interpretação da intenção humana baseada apenas em comportamentos observáveis, já que o sistema permite utilizar diretamente sinais cognitivos produzidos pelo cérebro durante a interação entre pessoas e máquinas. Apesar do potencial, a tecnologia ainda está longe de permitir que uma pessoa simplesmente pense que um robô está fazendo algo errado e faça a máquina parar imediatamente.

O sistema foi demonstrado em simulações, e não em um robô operando livremente em um ambiente real enquanto acompanha continuamente o EEG de uma pessoa e modifica sua conduta. Além disso, o EEG depende de eletrodos para medir sinais elétricos extremamente pequenos produzidos pelo cérebro, que podem apresentar ruído e são mais difíceis de obter fora de ambientes controlados. Por isso, ainda será necessário verificar o desempenho da NVA em interações naturais, nas quais as pessoas se movimentam e enfrentam situações muito menos previsíveis do que aquelas dos experimentos de laboratório.