EvalEval Coalition e AISI reforçam avaliação independente de modelos de inteligência artificial
Uma nova iniciativa da Coleta EvalEval Coalition, comunidade de pesquisa dedicada ao desenvolvimento de métodos cientificamente fundamentados para a avaliação de sistemas de inteligência artificial, está ganhando atenção no ecossistema de código aberto. A coalizão reúne contribuições de organizações como Hugging Face, Universidade de Edimburgo e EleutherAI, com o objetivo de criar infraestrutura aberta e padronizada para medir o impacto e os riscos de modelos cada vez mais poderosos.
A comunidade atua como um ponto de encontro para pesquisadores, profissionais e estudantes interessados em promover avaliações independentes e transparentes de inteligência artificial. Entre os projetos recentes divulgados pela coalizão estão o lançamento do EvalEval Grant Support, um programa de financiamento para iniciativas de avaliação, e a introdução das Evaluation Cards, uma camada interpretativa aberta para entender o ecossistema de avaliações de IA.
O tema das avaliações se tornou central no debate sobre segurança em inteligência artificial. Estudos recentes da própria coalizão apontam que a avaliação de modelos deixou de ser uma etapa secundária e passou a representar um gargalo computacional significativo. O relatório destaca que a execução de benchmarks abrangentes pode custar dezenas de milhares de dólares, com um único teste em modelos de fronteira chegando a valores próximos de três mil dólares antes de qualquer otimização por cache. Essas cifras evidenciam que apenas organizações com grande capacidade de investimento conseguem conduzir avaliações amplas, levantando questões sobre quem de fato controla os critérios usados para medir o progresso da inteligência artificial.
Nesse contexto, a parceria com órgãos independentes como o AI Safety Institute do Reino Unido, conhecido pela sigla AISI, ganha relevância estratégica. Avaliações conduzidas pelo instituto têm analisado a capacidade de modelos avançados de executar operações cibernéticas complexas e de múltiplas etapas ao longo de longos períodos, oferecendo dados empíricos sobre os riscos reais associados aos sistemas mais recentes. A integração entre a comunidade acadêmica, representada pela EvalEval Coalition, e instituições governamentais de segurança em IA representa um esforço para ampliar a transparência e a diversidade nas avaliações de modelos, evitando que poucos atores concentrem o poder de definir o que é considerado seguro ou confiável no setor.
A coalizão mantém um catálogo aberto de avaliações conhecido como Every Eval Ever, que reúne dados de execuções de diferentes benchmarks em diversos modelos. O projeto disponibiliza informações detalhadas sobre cada teste realizado, incluindo a metodologia, o modelo avaliado e os resultados obtidos. Essa abordagem visa facilitar a reprodução de estudos e a comparação entre diferentes sistemas, princípios considerados essenciais para o avanço responsável da inteligência artificial.
Com a crescente complexidade dos modelos e o aumento dos custos envolvidos em avaliá-los, iniciativas como a da EvalEval Coalition se posicionam como elementos centrais para garantir que o progresso da inteligência artificial seja acompanhado por mecanismos eficazes de verificação independente. A colaboração entre comunidade acadêmica, empresas de tecnologia e órgãos reguladores sinaliza um amadurecimento do campo, no qual a segurança e a transparência deixam de ser preocupações secundárias e passam a integrar a infraestrutura fundamental do desenvolvimento de IA.