A JetBrains anunciou o lançamento do Mellum2.1, um modelo de linguagem aberto desenvolvido especificamente para agentes de programação e subagentes de alta velocidade. O modelo possui 12 bilhões de parâmetros no total, mas ativa apenas 2,5 bilhões por token graças à arquitetura de mistura de especialistas, técnica que seleciona apenas uma parte da rede para processar cada elemento de texto, reduzindo o custo computacional. Os pesos estão disponíveis sob a licença Apache 2.0 na plataforma Hugging Face, permitindo uso, modificação e implantação sem restrições comerciais significativas.
O checkpoint divulgado chama-se Mellum2.1-12B-A2.5B-Thinking e é uma evolução direta do Mellum2 Thinking, aberto pela JetBrains em junho de 2026. Trata-se de um modelo de raciocínio, que emite sua cadeia de pensamento antes de apresentar a resposta final. Segundo a empresa, o objetivo é atender a três cenários: trabalho como agente autônomo, assistente geral de raciocínio e implantação privada em infraestrutura própria. O resultado é um sistema compacto, capaz de hospedar-se localmente, que explora um repositório de código, edita arquivos e verifica as próprias alterações.
A arquitetura permaneceu idêntica à da versão anterior, com 28 camadas e 64 especialistas, dos quais um roteador ativa 8 para cada token. O mecanismo de atenção usa consultas agrupadas, com 32 cabeças de consulta e 4 cabeças de memória, enquanto três de cada quatro camadas operam com uma janela deslizante de 1.024 tokens. O comprimento de contexto alcança 131.072 tokens, o vocabulário contém 98.304 entradas e os pesos são distribuídos no formato bfloat16, padrão numérico que equilibra precisão e eficiência.
Praticamente todo o avanço da nova versão veio do pós-treinamento com aprendizado por reforço, método que treina o modelo por meio de recompensas a partir de resultados verificáveis. A JetBrains transformou o que antes era um estágio curto ao final do processo na parte principal do treinamento, adicionando tarefas de matemática, programação competitiva, ciências, uso de ferramentas e engenharia de software. A empresa filtrou conjuntos de dados abertos para remover testes quebrados, respostas impossíveis de verificar e desafios excessivamente fáceis ou inviáveis.
Na engenharia de software, o treinamento ocorreu dentro de repositórios reais, com acesso a um terminal e a ferramentas de edição de arquivos, sendo o modelo recompensado sempre que os testes fossem aprovados. Para viabilizar esse processo em escala, a JetBrains executou milhões de ambientes de execução isolados, os chamados sandboxes, distribuídos em milhares de configurações distintas, simulando condições reais de desenvolvimento.
Nos testes de desempenho, conduzidos com um único pipeline em modo de raciocínio, o maior salto apareceu na programação agentiva, área em que o modelo atua de forma autônoma em múltiplas etapas. O índice no SWE-bench Verified, avaliação que mede a capacidade de resolver problemas reais em repositórios de código, subiu de 2.0 para 47.0. No SWE-bench Pro, a pontuação passou de 0.0 para 28.0, e no Terminal-Bench 2.1, que avalia tarefas no terminal, o crescimento foi de 0.6 para 17.4. As execuções agentivas utilizaram a estrutura de código aberto Pi v0.73.1, com contexto de 114 mil tokens.
O Mellum2.1 superou a versão anterior em 15 dos 17 testes listados e venceu o Qwen3.5-9B em 5 deles. O modelo lidera o grupo no LiveCodeBench v6 com 82.0 pontos, à frente do Qwen3.5-9B, que marcou 75.4, e do Gemma 4 E4B, com 69.4. Também fica na frente no HumanEval+, com 91.5, no MBPP+, com 79.4, e no BFCL v4, avaliação de chamada de funções, com 62.3. Houve ainda melhora em segurança: o HarmBench caiu de 21.5 para 8.5, e nesse caso quanto menor a pontuação, melhor.
O Qwen3.5-9B, contudo, segue à frente nas tarefas agentivas mais difíceis e em conhecimento geral, com 50.0 no SWE-bench Verified, 38.0 no SWE-bench Pro, 86.7 no AIME 25/26, prova de matemática, e 77.8 no GPQA Diamond. A própria JetBrains reconhece que os pipelines de avaliação influenciam os números: a ficha oficial da Qwen registra 65.6 no LiveCodeBench v6 e 81.7 no GPQA Diamond, enquanto a medição da JetBrains encontrou 75.4 e 77.8 para o mesmo modelo. Todas as pontuações divulgadas são autorrelatadas pela empresa.
Como o pós-treinamento não alterou a arquitetura, a velocidade equivale à do Mellum2. Em uma única placa NVIDIA H200 sob carga intensa, o modelo entrega quase o dobro de tokens por segundo do Qwen3.5-9B, segundo a JetBrains. Em requisições individuais, a previsão de múltiplos tokens acelera o processamento em cerca de 1,6 vez. O componente de previsão de múltiplos tokens para decodificação especulativa no vLLM ainda está em desenvolvimento.
Para execução local, o modelo completo funciona no vLLM com o analisador de raciocínio qwen3, e o suporte a chamadas de ferramentas exige parâmetros adicionais de configuração. A JetBrains recomenda temperatura de 0.6, com valores de amostragem de 0.95 e 20. Conversões no formato GGUF já estão disponíveis em cinco variantes, começando em 7.0 gigabytes e chegando a 24.3 gigabytes na versão de referência, compatíveis com llama.cpp, Ollama e LM Studio. A variante recomendada ocupa 8.1 gigabytes, tamanho que, segundo a avaliação, torna práticos os subagentes de programação rodando localmente.