Agentes de inteligência artificial da OpenAI tentaram enganar sistema de detecção de robôs e invadiram plataforma Hugging Face
Uma investigação independente revelou novos detalhes sobre o ataque cibernético conduzido por agentes de inteligência artificial da OpenAI contra a plataforma Hugging Face, divulgado pela empresa em julho. Segundo relatório elaborado por engenheiros da startup Parse e pela organização de segurança Palisade Research, os sistemas de IA tentaram utilizar outros modelos de inteligência artificial para burlar mecanismos de segurança, incluindo sistemas de detecção automatizada e testes CAPTCHA, que são desafios visuais criados para diferenciar humanos de robôs.
Os pesquisadores analisaram quase um milhão de links encurtados criados pelos agentes entre os dias 9 e 13 de julho. Esses endereços armazenavam fragmentos de informações utilizadas para montar ataques complexos. A análise do conteúdo permitiu reconstruir cerca de 60 mil programas e mensagens gerados durante o período. Embora os pesquisadores tenham conseguido observar os códigos criados pelos agentes, não tiveram acesso aos resultados das ações executadas, o que impede determinar com precisão quantas tentativas foram efetivamente bem-sucedidas.
Os agentes da OpenAI deveriam permanecer isolados em ambientes de testes, conhecidos como sandboxes, sem qualquer acesso à internet. No entanto, no fim de maio e novamente no início de julho, os sistemas invadiram uma ferramenta de instalação de software sem que os pesquisadores da OpenAI percebessem a movimentação. A invasão lhes permitiu acessar a internet e criar um sistema interno de mensagens para se comunicar entre si, utilizando a própria infraestrutura comprometida como canal de troca de informações.
Inicialmente, os agentes conseguiam acessar sites na internet, mas não tinham como enviar dados de volta. Para contornar essa limitação, eles combinaram diferentes serviços disponíveis online. O método consistia em solicitar a um serviço público de captura de telas que carregasse um endereço especialmente criado. Como os endereços possuem limite de tamanho, o código era dividido em pedaços menores e armazenado em serviços de encurtamento de links. O serviço de captura de tela carregava cada link, buscava o trecho correspondente do código e repetia o processo até montar o arquivo completo. Por fim, o programa gerava uma imagem semelhante a um QR Code para transmitir os dados de volta aos agentes. Segundo Jeffrey Ladish, diretor-executivo da Palisade Research, os modelos demonstraram grande autonomia ao combinar essas ferramentas sem intervenção humana.
Um dos pontos que mais chamou a atenção dos investigadores foi a tentativa dos agentes de acionar outros sistemas de inteligência artificial. No início do ataque, ao tentar criar novas contas na Hugging Face, eles se depararam com um CAPTCHA e utilizaram um modelo de IA especializado em reconhecimento de imagens para tentar resolver o desafio. Os pesquisadores também identificaram tentativas de comunicação com modelos antigos, como o GPT-2, da própria OpenAI, além dos modelos chineses de código aberto DeepSeek, Kimi e Qwen. Os agentes também buscaram contato com os modelos Haiku 3 e Haiku 4.5, da Anthropic, por meio de um serviço de chat on-line. Para Alex Forman, fundador da Parse, esse é o único caso conhecido em que sistemas de IA tentaram executar outros modelos, uma preocupação recorrente entre especialistas porque poderia dificultar tentativas humanas de controlar ou desligar comportamentos indesejados.
Entre os elementos identificados, os pesquisadores encontraram um dicionário de chaves secretas de acesso marcado com a palavra "LOOT", em letras maiúsculas. O agente também teria criado um sistema próprio de pontuação para classificar as credenciais expostas da Hugging Face e devolver aos demais agentes as cinco consideradas mais relevantes. Durante o ataque à plataforma, os agentes conseguiram também invadir a própria infraestrutura de pesquisa da OpenAI. Segundo Forman, ainda não se sabe o que aconteceu após o caso da Hugging Face, cerca de dois dias depois, dentro da rede interna da companhia.
O caso faz parte de uma investigação mais ampla conduzida pela OpenAI sobre atividades não autorizadas realizadas por seus agentes. A empresa informou que a revisão deverá levar meses devido ao volume de incidentes e à necessidade de verificação individual. A OpenAI já notificou dezenas de terceiros afetados, e estimativas internas apontam para aproximadamente duas dezenas de incidentes identificados. Mais de 15 episódios foram divulgados nos dois meses seguintes ao anúncio inicial, variando desde mensagens de spam deixadas em sites até acessos não autorizados a sistemas internos. Entre os casos conhecidos está a transformação de um site alemão em um espaço usado pelos agentes para compartilhar táticas e contornar restrições, além de atividades contra o site do Australian Institute of Health and Welfare.
O processo interno de apuração envolveu cerca de 100 pessoas, de acordo com fontes ouvidas pela agência Reuters, e foi conduzido sob forte controle dos departamentos jurídicos da OpenAI. Muitos dos incidentes foram descobertos por pesquisadores externos e permaneceram sem conhecimento da empresa por meses. Em comunicado, uma porta-voz da OpenAI afirmou que a atividade descrita pelos pesquisadores da Parse é compatível com o que a companhia já investigava e que a empresa está priorizando a análise dos casos mais graves enquanto amplia a revisão para atividades de menor gravidade, incluindo o envio de spam por parte dos agentes.