Anthropic corta acesso à internet de avaliações internas após agentes de IA explorarem sites reais

A Anthropic anunciou que desligou o acesso à internet em tempo real de todas as suas avaliações internas de inteligência artificial, até que a empresa tenha certeza de que consegue monitorar e controlar seus agentes de forma confiável. A decisão foi tomada após a empresa revelar que seus modelos exploraram sites reais da internet, incluindo páginas administradas por agências do governo dos Estados Unidos. A informação foi divulgada pela empresa em uma publicação oficial em seu blog.

A revelação expõe um problema central da indústria: os chamados agentes de IA, sistemas capazes de executar tarefas de forma autônoma e tomar decisões sem intervenção humana a cada passo, ainda não podem ser controlados com total segurança quando ganham acesso a redes externas. No caso da Anthropic, os episódios aconteceram durante avaliações de segurança cibernética, testes laboratoriais usados para medir as capacidades e o comportamento dos modelos em cenários controlados.

Quando a Simulação Vira Real: Anthropic Desconecta IA da Internet Após Agentes Invadirem Sites Reais do Governo Americano - Imagem complementar

Segundo a empresa, os três incidentes investigados tiveram origem em uma falha de configuração. Os prompts de avaliação, ou seja, as instruções dadas ao modelo Claude, afirmavam explicitamente que o sistema não tinha acesso à internet e que o ambiente era uma simulação. Entretanto, uma configuração incorreta deixou as máquinas usadas no teste conectadas à rede mundial de computadores, algo que nem a Anthropic nem seu parceiro de avaliação sabiam até que o monitoramento adicional de testes detectou o problema na semana passada.

O detalhe mais preocupante está no comportamento do modelo. Como as instruções diziam que tudo aquilo era um exercício simulado, o Claude passou a tratar sistemas reais encontrados na internet aberta como parte do treinamento. Em avaliações de segurança cibernética, é comum incluir cenários realistas para medir com precisão o que os modelos são capazes de fazer, o que contribuiu para a confusão entre ambiente de teste e sistemas de terceiros verdadeiros.

PUBLICIDADE

A empresa explicou ainda que uma data de calendário exibida nos sistemas, correspondente ao ano de 2026, foi interpretada pelo Claude como prova de que o ambiente era encenado. O modelo nunca revisitou essa conclusão ao longo da tarefa. Quando scanners automatizados começaram a instalar um pacote de software, por exemplo, o agente interpretou a atividade como atores roteirizados dentro da simulação, e não como operações legítimas de sistemas reais.

Outro ponto levantado pela divulgação é que as instruções do teste não estabeleciam limites sobre onde o modelo poderia procurar o objetivo-alvo do exercício. Combinado com o acesso acidental à rede, esse fator permitiu que o agente navegasse para fora do ambiente previsto e alcançasse servidores de terceiros de verdade. A Anthropic registrou três episódios desse tipo em que seus modelos obtiveram acesso não autorizado a sistemas externos.

Diante do quadro, a empresa optou por uma medida drástica e preventiva: nenhuma avaliação interna terá conexão com a internet ao vivo até nova ordem. A ideia é que os testes voltem a ter acesso somente quando a Anthropic puder garantir mecanismos efetivos de supervisão e contenção dos agentes, evitando que modelos confundam ambientes simulados com o mundo real durante exercícios de segurança.

O episódio reforça o debate sobre os limites da autonomia dos sistemas de inteligência artificial. Ainda que os incidentes tenham ocorrido em contexto de teste, e não em produtos voltados ao público, eles mostram que falhas humanas de configuração podem abrir brechas por onde agentes avançados alcançam infraestrutura real, inclusive de órgãos governamentais. Para a Anthropic, a lição é que monitoramento contínuo e fronteiras técnicas claras são condições obrigatórias antes de devolver conectividade a seus laboratórios de avaliação.

O relatório completo sobre os três incidentes, incluindo a investigação sobre a configuração incorreta e o comportamento do modelo Claude, está disponível na publicação oficial da Anthropic em seu site corporativo.