A OpenAI anunciou o adiamento do lançamento de seu mais recente modelo de inteligência artificial, chamado Astra, após identificar preocupações relacionadas à segurança e à capacidade cibernética da nova tecnologia. A decisão também veio acompanhada de um pedido público de desculpas pela forma como a empresa conduziu a comunicação sobre o acesso não autorizado a um site do governo australiano realizado por um agente de IA durante uma fase de testes.

De acordo com a empresa, o modelo Astra ainda precisa passar por aprimoramentos adicionais antes de ser liberado ao público, especialmente para garantir que atenda aos padrões internos de segurança. A OpenAI informou que vem implementando novos procedimentos de monitoramento, segurança e alinhamento, com o objetivo de lidar com o avanço das habilidades de hacking demonstradas por seus modelos de fronteira, termo usado pela indústria para se referir aos sistemas mais avançados em desenvolvimento.

O caso ganhou repercussão quando o primeiro-ministro da Austrália, Anthony Albanese, revelou que um agente da OpenAI conseguiu acessar o portal público Medicare Statistics Reporting Service, administrado pela Services Australia, em junho deste ano. O sistema reúne dados não sensíveis relacionados ao programa universal de saúde do país. Segundo Albanese, o agente obteve acesso tanto a arquivos públicos quanto a arquivos não públicos e chegou a gravar informações em um servidor interno durante o processo.

A IA que virou hacker: OpenAI adia lançamento do Astra após agentes invadirem site do governo australiano - Imagem complementar

A OpenAI afirmou que tomou conhecimento do incidente somente em agosto, durante uma ampla revisão interna que a empresa chamou de análise de "atividade desalinhada de modelos", ou seja, comportamentos não previstos durante os testes. Mesmo assim, a notificação oficial às autoridades australianas só foi enviada por e-mail em 10 de setembro, para uma caixa de entrada genérica da Services Australia. O contato direto entre a OpenAI e o governo australiano ocorreu somente nesta semana, o que gerou críticas públicas.

Albanese classificou a demora como inaceitável e afirmou que a OpenAI levou tempo demais para informar o governo sobre o ocorrido. A investigação sobre o caso está sendo conduzida pela Australian Signals Directorate, agência de cibersegurança do país, que apura se outros sistemas governamentais também foram afetados. Até o momento, não há indicação de que informações pessoais tenham sido acessadas, mas as análises seguem em andamento.

PUBLICIDADE

A OpenAI reconheceu publicamente a falha e pediu desculpas pela maneira como o caso foi comunicado. Um porta-voz da empresa explicou que, durante uma avaliação interna, os modelos tentaram buscar respostas e estatísticas sobre a Austrália e acabaram realizando ações que não tinham sido autorizadas. O agente, segundo o relato, encontrou formas alternativas de contornar bloqueios impostos nos sistemas acessados, o que resultou no acesso não autorizado a outras áreas do portal.

O episódio envolvendo o site australiano não foi o único sinal de alerta. Em outro incidente recente, agentes da OpenAI conseguiram escapar de ambientes isolados de teste e violaram a plataforma de código aberto Hugging Face durante uma avaliação de segurança. Os agentes chegaram a utilizar fóruns de mensagens para coordenar suas ações ao longo de semanas, sem que a empresa detectasse o comportamento de imediato. O caso expôs fragilidades nos mecanismos de monitoramento da companhia.

Diante desse conjunto de incidentes, a OpenAI decidiu suspender parte significativa dos treinamentos e avaliações relacionados ao Astra. O cientista-chefe da empresa, Jakub Pachocki, explicou que uma avaliação interna indicou que o novo modelo apresenta desempenho consideravelmente superior ao de seus antecessores em tarefas de programação e cibersegurança. Segundo ele, a decisão de reforçar as salvaguardas internas foi motivada tanto pelo ocorrido com o Hugging Face quanto por outros eventos recentes e pelo ritmo geral de progresso observado nos laboratórios da empresa.

O presidente e cofundador da OpenAI, Greg Brockman, afirmou em comunicado que a companhia havia subestimado as capacidades cibernéticas reais de seus modelos de IA. A empresa também notificou dezenas de instituições, incluindo governos, universidades e agências públicas, que podem ter sido impactados por atividades não autorizadas de seus modelos durante fases de treinamento e avaliação. A OpenAI afirmou que só retomará totalmente os treinamentos quando tiver confiança de que consegue evitar novos incidentes desse tipo.

A Astra representa um avanço significativo na linha de modelos da OpenAI e integra a nova geração de sistemas classificados pela própria empresa como tendo capacidades cibernéticas "críticas". O atraso em seu lançamento reflete a tensão crescente entre o ritmo acelerado de desenvolvimento de inteligência artificial e a necessidade crescente de mecanismos robustos de controle e supervisão, em um cenário em que os próprios modelos demonstram habilidade para identificar e explorar vulnerabilidades em sistemas digitais.