A Underdog, assistente para dispositivos locais desenvolvido pela Conway Research, lançou o modelo Saluki 27B sob licença Apache 2.0. Trata-se de uma versão comprimida em 2 bits do Qwen3.8-27B, distribuída no formato GGUF, padrão usado por ferramentas de execução local de modelos de linguagem. O resultado é um arquivo de apenas 7,89 GB, contra os 54 GB exigidos pelo modelo original em BF16, um formato numérico de alta precisão. O ajuste da compressão foi direcionado para preservar a chamada de ferramentas, competência que transforma um chatbot em um agente capaz de executar ações.

Para os desenvolvedores, a proposta é ter um modelo agêntico da classe de 27 bilhões de parâmetros rodando no llama.cpp padrão, com transferência completa para a GPU. Há ainda um módulo opcional de visão, disponível em duas variantes de 629 MB ou 928 MB. Segundo a Underdog, o Saluki mantém 96% da performance média do Qwen3.8-27B original em nove benchmarks. O destaque está nas chamadas paralelas de ferramentas, em que a versão comprimida atinge 42 pontos contra 35 do modelo completo, uma retenção de 120%. O ponto mais fraco aparece no AIME 2025, avaliação de matemática competitiva, com 79,2 pontos contra 96,7 do original, retenção de aproximadamente 82%.

A construção do Saluki combina três camadas de trabalho. A base é o Qwen3.8-27B, modelo denso de 27 bilhões de parâmetros criado pela equipe Qwen, com 64 camadas que misturam atenção linear do tipo Gated DeltaNet com atenção gated, e suporte nativo a 262.144 tokens de contexto. A segunda camada vem do arquivo Qwen3.8-27B-GSQ-RCO-GGUF, publicado pelo grupo ISTA-DASLab. Nesse trabalho, a técnica GSQ aprende grades escalares de baixa precisão precisas para cada tensor, enquanto o RCO define o tipo de quantização de cada tensor dentro de um orçamento fixo de tamanho. O menor arquivo do ISTA, chamado IQ2_XS, ocupa 8,4 GB a 2,50 bits por peso.

Saluki 27B: a IA comprimida que cabe em menos de 8 GB e supera o gigante Qwen3.8-27B na chamada de ferramentas - Imagem complementar

A terceira camada é o próprio ajuste da Underdog, que reduziu o arquivo para 7,89 GB com foco específico na chamada de ferramentas. O arquivo recebeu o nome de IQ2-mix e carrega uma etiqueta imatrix, referência a um método de importância de matrizes usado na compressão. A empresa não divulgou a receita completa dessa etapa final do processo.

Nos testes conduzidos pela própria Underdog, ambos os modelos rodaram na mesma plataforma de avaliação. No Underdog Bench, conjunto de 120 tarefas do BFCL v4 congelado antes dos testes, executado com modo de raciocínio desligado e temperatura zero, o Saluki marcou 88 pontos, o modelo completo fez 84 e o Bonsai 2, da PrismML, ficou em 70. Nas 100 tarefas de chamadas paralelas de ferramentas do BFCL v4, verificadas com o verificador oficial, o placar foi de 42 a 35 para o Saluki. No SWE-bench Verified, com 50 problemas de engenharia de software, o modelo comprimido resolveu 30 questões, contra 33 da versão integral.

PUBLICIDADE

Outro grupo de resultados compara o Saluki com notas públicas do Qwen3.8-27B em tamanho completo. O modelo comprimido vence no IFEval, com 93,5 contra 91,5, e no IFBench, com 72,7 contra 71,0. No MBPP+, teste de programação, perde por 78,0 a 83,9. A queda se aprofunda no MuSR, de raciocínio multietapas, com 67,5 contra 79,6, e nas avaliações de matemática: 79,2 contra 96,7 no AIME 2025 e 80,0 contra 94,6 no AIME 2026. No balanço geral, competição matemática e raciocínio em múltiplas etapas recuam entre 12 e 18 pontos.

O Saluki também foi colocado ao lado de outras construções compactas do mesmo modelo base. O Bonsai 2, da PrismML, tem 27,36 bilhões de parâmetros e ocupa apenas 5,95 GB a 1,75 bit por peso, com retenção de 98,2% do FP16 em 14 benchmarks de modo raciocínio. Ele ainda apresenta matemática mais forte, incluindo 95,0 pontos no AIME25. A limitação é que o Bonsai 2 exige um fork do llama.cpp mantido pela PrismML, já que a versão padrão do executor rejeita seus formatos de empacotamento. O Saluki, por sua vez, roda no llama.cpp convencional. A Underdog ressalta que cada fabricante usa sua própria estrutura de testes, o que impede comparação direta entre os números divulgados por empresas diferentes.

O Saluki 27B chega ao mercado como opção para rodar agentes de inteligência artificial localmente, com licença aberta Apache 2.0. O modelo comprime o Qwen3.8-27B de 54 GB para 7,89 GB, supera o original na chamada de ferramentas por 88 a 84 e nas chamadas paralelas por 42 a 35, e funciona no llama.cpp padrão. O custo da compressão aparece na matemática e no raciocínio complexo, com quedas de 12 a 18 pontos. O cartão do modelo está publicado na plataforma Hugging Face, e o anúncio foi feito na página de lançamento da Underdog.