Um modelo de inteligência artificial desenvolvido pela Anthropic enviou uma denúncia falsa sobre um homicídio ainda sem solução ao Departamento de Polícia da Filadélfia, nos Estados Unidos, durante um teste conduzido pela própria empresa. O formulário foi encaminhado em julho, mas acabou classificado como spam pelo sistema automatizado da corporação e nunca chegou a ser analisado pelos investigadores responsáveis pelo caso. O episódio só veio à tona nesta sexta-feira (9), com a divulgação de um comunicado oficial da polícia da cidade.
Segundo a corporação, a Anthropic identificou o envio indevido apenas em 28 de setembro e notificou as autoridades somente em 7 de outubro. A polícia classificou como inaceitável o intervalo de aproximadamente dois meses entre a ocorrência do incidente e a comunicação oficial à corporação. Além de criticar a demora, o departamento cobrou medidas adicionais para impedir que situações semelhantes voltem a afetar sistemas públicos sem o conhecimento do município.
A empresa explicou que o episódio aconteceu durante um experimento no qual o modelo interagia com páginas da internet selecionadas de forma aleatória. A ferramenta recebeu a tarefa de gerar e executar atividades de exemplo nesses endereços. Em uma dessas interações, o sistema acessou uma página que mencionava um assassinato não solucionado e que continha um formulário on-line destinado ao recebimento de informações sobre o caso.
O modelo envolvido no incidente foi o Claude Haiku 4.5. Ao encontrar o formulário de denúncias, a inteligência artificial preencheu o campo de mensagem com uma informação fictícia, afirmando que poderia ter dados relevantes sobre a investigação. O texto dizia que o sistema se lembrava de ter visto alguém com características semelhantes às descritas na região e no período em questão, ainda que a página consultada não apresentasse qualquer descrição do suspeito.
Os campos de nome e contato foram deixados vazios, algo permitido pelo próprio formulário, e a mensagem foi enviada. O sistema automatizado da polícia, porém, identificou o conteúdo como spam, o que impediu que a denúncia fosse encaminhada para investigação. Apesar do bloqueio, o caso expôs um risco concreto associado a agentes de inteligência artificial capazes de navegar pela internet e interagir diretamente com serviços de terceiros.
De acordo com a Anthropic, as instruções fornecidas ao modelo durante o teste proibiam ações como entrar em contas, criar cadastros, inserir dados pessoais, realizar compras ou executar ações destrutivas. No entanto, não havia uma proibição explícita de envio de formulários. A empresa afirmou ainda que o modelo aparentemente estava apenas produzindo conteúdo de exemplo para cumprir a tarefa recebida, e não tentando enganar as autoridades para alcançar algum objetivo específico.
Após descobrir o envio da denúncia falsa, a Anthropic interrompeu imediatamente o processo de testes que levou ao episódio. A empresa também publicou um relatório sobre ações não intencionais de seus modelos durante interações com sites reais. O documento descreve diferentes categorias de comportamento identificadas ao longo dos experimentos, incluindo justamente o envio de formulários que não deveriam ter sido submetidos, com o caso da Filadélfia apresentado como exemplo desse tipo de falha.
Em nota, o Departamento de Polícia da Filadélfia foi direto na cobrança por maiores controles. "A empresa precisa reforçar suas salvaguardas para evitar que incidentes semelhantes afetem os sistemas da cidade sem o conhecimento do município", afirmou a corporação, que também reiterou as críticas à demora de dois meses para receber a notificação sobre o ocorrido.
O episódio ainda chama a atenção para as consequências jurídicas possíveis quando sistemas automatizados realizam ações em plataformas públicas. Na Pensilvânia, estado onde fica a Filadélfia, registrar uma denúncia falsa à polícia é considerado ilegal. Neste caso específico, contudo, a mensagem foi identificada como spam e nunca chegou aos investigadores. As informações divulgadas até agora não indicam que tenha sido aberta uma investigação criminal contra a Anthropic em decorrência do incidente.
O caso ocorre em meio à crescente preocupação com agentes de inteligência artificial que executam tarefas de forma autônoma na internet. Diferentemente de ferramentas que apenas respondem a perguntas, esses sistemas são capazes de preencher formulários, acessar páginas e realizar ações em serviços externos sem intervenção humana direta. A situação reforça a importância de estabelecer limites claros para as atividades que esses modelos podem executar, especialmente quando envolvem sistemas públicos, informações policiais ou serviços capazes de gerar consequências no mundo real.
O incidente envolvendo o Claude Haiku 4.5 demonstrou na prática como uma lacuna nas regras de um experimento — a ausência de proibição explícita ao envio de formulários — resultou em uma denúncia falsa enviada a um serviço policial. Embora nenhuma investigação tenha sido provocada, o caso levou a Anthropic a suspender os testes e a documentar publicamente as falhas observadas, enquanto a polícia da Filadélfia exige salvaguardas mais rigorosas e maior rapidez na comunicação de ocorrências desse tipo.