Alibaba abre o código de seu maior modelo de linguagem e amplia o ecossistema de IA aberta

A Alibaba disponibilizou os pesos abertos do Qwen3.8-2.4T-A95B, também chamado de Qwen3.8-Max, seu maior modelo de inteligência artificial com pesos públicos até o momento. O lançamento coloca capacidades de alto desempenho à disposição da comunidade de código aberto, aproximando o ecossistema aberto do nível dos modelos mais avançados disponíveis no mercado.

Alibaba Revoluciona o Ecossistema de IA Aberta com Lançamento de Modelo de Linguagem de 2,4 Trilhões de Parâmetros - Imagem complementar

O modelo possui 2,4 trilhões de parâmetros totais, mas ativa apenas 95 bilhões para processar cada bloco de texto, conhecido como token. Essa arquitetura é baseada em uma técnica chamada mistura de especialistas, abreviada como MoE (do inglês Mixture of Experts). Em vez de usar todos os parâmetros ao mesmo tempo, o modelo distribui o trabalho entre diferentes módulos especializados, escolhendo quais deles ativar em cada etapa. Esse mecanismo reduz significativamente o custo computacional durante a geração de respostas, já que apenas uma fração da rede é acionada por token.

PUBLICIDADE

De acordo com informações técnicas divulgadas, o Qwen3.8-Max conta com 512 especialistas roteados, dos quais dez são ativados por token, além de um especialista compartilhado. Toda essa estrutura opera sobre uma base de 92 camadas com mecanismo de atenção híbrida, combinando atenção completa com atenção linear. Na prática, a atenção completa permite que cada token se relacione com todos os demais tokens do contexto, enquanto a atenção linear substitui o crescente cache de pares chave-valor por um estado recorrente de tamanho limitado, ajudando a controlar o consumo de memória e processamento conforme o contexto aumenta.

O modelo suporta uma janela de contexto nativa de 262.144 tokens, equivalente a um volume de texto bastante extenso, e pode ser estendida para aproximadamente um milhão de tokens por meio de mecanismos adicionais. Essa capacidade é especialmente relevante para tarefas que exigem a análise de documentos longos, bases de código ou conversas prolongadas.

Outra característica central do Qwen3.8-Max é a profundidade de raciocínio configurável. Desenvolvedores podem escolher, em cada requisição, entre os níveis baixo, alto e muito alto de esforço de raciocínio. Essa funcionalidade cria uma relação direta entre custo computacional e capacidade analítica. Tarefas mais complexas, como programação avançada ou fluxos com múltiplos agentes, podem exigir maior poder de processamento, enquanto atividades como leitura de documentos podem ser executadas com menor esforço, priorizando velocidade.

A NVIDIA publicou resultados de inferência no dia do lançamento, demonstrando o modelo rodando em seu sistema GB300 NVL72, uma plataforma em escala de rack voltada para cargas de trabalho de inteligência artificial. A implementação inicial da NVIDIA, no formato de precisão FP8, utiliza uma representação numérica reduzida para os pesos do modelo, alcançando rendimento superior a 4.000 tokens por segundo, mesmo sem ajustes adicionais ao modelo. O resultado chamou a atenção por mostrar que um modelo com 2,4 trilhões de parâmetros totais pode operar com boa vazão em hardware comercial de alto desempenho.

O tamanho do modelo, no entanto, impõe desafios práticos de implantação. O arquivo de pesos no formato BF16, que utiliza 16 bits por parâmetro, ocupa cerca de 4,45 terabytes e exige múltiplos nós de GPU para ser carregado em memória. Formatos compactos reduzem esse requisito de forma expressiva. A variante NVFP4 W4A4, otimizada para processadores NVIDIA Blackwell, ocupa apenas 1,32 terabyte e permite rodar o modelo em um único nó com oito GPUs B300. Já a versão MXFP4, voltada para accelerators AMD Instinct, leva o tamanho para 1,45 terabyte e também cabe em um nó com oito MI355X. Versões intermediárias em FP8 reduzem o espaço para 2,27 terabytes.

O lançamento do Qwen3.8-Max representa mais um passo significativo na estratégia da Alibaba de fortalecer o ecossistema de modelos abertos. Ao tornar acessível um modelo dessa escala e com arquitetura avançada, a empresa amplia as opções disponíveis para pesquisadores e empresas que dependem de pesos abertos para treinar, ajustar ou implantar sistemas de inteligência artificial sem depender exclusivamente de soluções proprietárias.