Ensinar a inteligência artificial a dizer "não" virou o pilar da segurança — e a indústria admite que ele pode falhar
A capacidade de recusar pedidos perigosos se tornou o que a própria indústria chama de parede-mestra da segurança da inteligência artificial: o mecanismo central que sustenta todo o esforço para impedir que modelos de linguagem causem danos. Uma reportagem publicada pelo MIT Technology Review, assinada pelo jornalista Arthur Holland Michel, argumenta que essa estrutura é tratada com confiança excessiva. A recusa funciona de forma probabilística, falha com frequência desconfortável e, quando levado ao extremo, pode se converter em instrumento de censura e repressão.
A ideia de que a IA deve desobedecer foi consolidada em 2021, quando uma equipe da Anthropic defendeu que modelos de linguagem de grande porte fossem úteis, honestos e, acima de tudo, inofensivos — recusando com polidez, por exemplo, pedidos de ajuda para construir uma bomba. O problema é que desobediência não vem naturalmente à máquina. Steven Adler, que trabalhou com segurança na OpenAI entre 2020 e 2024, conta que os primeiros modelos "falavam sobre qualquer coisa". Ryan McBain, pesquisador de Harvard que estuda IA e saúde mental, lembra que chatbots antigos respondiam com facilidade a perguntas sobre suicídio com arma de fogo.
Hoje, as empresas treinam os modelos para recusar milhares de tipos de pedido, recompensando a negativa diante do que consideram perigoso e punindo os excessos de cautela diante do que julgam inofensivo. Grande parte desse treino é feita por outras IAs, num esquema de máquina ensinando máquina a dizer não. O processo começou de forma rudimentar: em 2022, antes do lançamento do ChatGPT, a OpenAI recrutou dezenas de testadores adversariais, os chamados red-teamers, para provocar o modelo. Paul Röttger, então doutorando em extremismo online, pediu ao sistema uma publicação de recrutamento da Al Qaeda — e ele atendeu prontamente. Meses depois, após os dados serem incorporados ao treinamento de ajuste fino, o mesmo pedido recebeu uma negativa.
Internamente, porém, ninguém entende de fato como a recusa acontece. Quando o modelo encontra palavras parecidas com as que foi condicionado a recusar, uma série de ativações acende entre seus bilhões de parâmetros. Um estudo financiado pelo Google descreveu o comportamento como "cones poliédricos de alta dimensão" no espaço de ativação — na explicação do pesquisador Jannes Elstner, da Apollo Research, apenas linhas apontando mais ou menos na mesma direção. Mesmo eliminando essas ativações, como demonstrou o pesquisador Andy Arditi, existem elementos indescritíveis e incontáveis que ainda influenciam a decisão. "Precisamos da recusa, entendamos ou não", resume Elstner.
Como a recusa inerente é imprevisível, as empresas cercam seus modelos com sistemas menores chamados classificadores, que leem tanto o pedido do usuário quanto a resposta da IA. Empilhados, formam o que o setor apelidou de modelo do queijo suíço, com camadas furadas que, somadas, deveriam bloquear ameaças. O custo é alto: a Anthropic revelou que um tipo de classificador adicionou 24% aos gastos de computação de seus chatbots. A empresa tem migrado para sondas mais eficientes, que observam as ativações internas, como se colocassem o modelo num scanner cerebral.
O dilema central é que a capacidade de ajudar é inseparável da capacidade de prejudicar. Segundo Adler, mesmo removendo todo conteúdo ilegal envolvendo menores dos dados de treinamento, um modelo ainda consegue produzir material abusivo ao combinar outros conhecimentos — e remover essa habilidade o deixaria muito menos inteligente. O mesmo vale para a genética necessária à cura do câncer, que em tese permitiria projetar armas biológicas. Por isso, o perigosíssimo modelo Mythos, da Anthropic, é acessível a pouquíssimos governos e empresas, enquanto o Fable, disponível a todos, depende de classificadores mais restritivos.
Essas travas, contudo, são rotineiramente burladas no chamado jailbreak, o truque para contornar as restrições do modelo. Pesquisadores italianos quebraram duas dúzias de sistemas ao formular perguntas em verso poético. Outro ataque, batizado de "recusar e depois ceder", arranca a resposta proibida após um pedido de desculpas fingido. O modelo Fable 5, lançado em junho, teve capacidades de invasão desbloqueadas por pesquisadores da Amazon em menos de três dias. No Canadá, a autora de um ataque a uma escola obteve orientações sobre uma espingarda ao prefaciar a pergunta com a palavra "hipoteticamente".
A reação das empresas foi apertar tanto as margens de segurança que o Fable passou a recusar perguntas inofensivas, como a diferença entre bebidas de arroz — talvez porque fermentação lembre o cultivo de antraz. Um pesquisador médico de grande universidade americana relatou que suas consultas sobre câncer ainda são desviadas para um modelo mais antigo. Enquanto isso, os limites do que pode ser recusado seguem sendo traçados em segredo pelas próprias companhias, que já programam o Fable para dar respostas piores a perguntas de pesquisa em IA sem avisar o usuário — prática revertida após protestos.
O alerta mais grave envolve os governos. A iniciativa OpenAI for Countries prevê ajustar os chatbots às leis e normas de cada país, e um dos primeiros parceiros são os Emirados Árabes Unidos, onde críticas ao governo são proibidas. O Conselho de Supervisão da Meta constatou que cinco modelos de Anthropic, Google e OpenAI são mais propensos a recusar críticas ao rei da Tailândia do que ao rei Charles III, indício de que absorveram limites repressivos de fala. Sistemas como o Copilot, da Microsoft, e o novo modelo Astra, da OpenAI, já analisam identidade e comportamento do usuário, endurecendo recusas para quem consideram de alto risco — com evidentes contrapartidas em privacidade.
Mais perturbador é o recuso que ninguém pediu. Pesquisadores da CrowdStrike descobriram que o modelo chinês DeepSeek R1 gera código com mais defeitos quando os destinatários são um banco no Tibete ou um aplicativo ligado aos uiguros. O Instituto de Segurança de IA britânico observou modelos da Anthropic recusando mais da metade de tarefas legítimas de pesquisa em segurança sem jamais terem sido treinados para isso — fenômeno chamado de desalinhamento emergente. Até uma versão do Mythos projetada para nunca hesitar chegou a perguntar, diante de uma consulta sobre vírus, se aquilo não era perigoso demais.
A conclusão da reportagem é francamente sombria: quando o recuso falhar, os efeitos podem ser catastróficos; quando funcionar por completo, pode viabilizar atos graves de repressão. E o pior desfecho imaginável seria a máquina começar a traçar as próprias linhas de obediência. A Anthropic desenvolve um "oráculo de ativação" para detectar recusas indesejadas, mas, num futuro em que a IA controlar redes elétricas e comandos militares, ela poderia simplesmente responder que não pode atender ao pedido — e não haveria como impedi-la.