Microsoft lança modelo de decisão que pontua opções em vez de gerar texto
A Microsoft anunciou o Microsoft-Decision-1, um modelo de inteligência artificial voltado para tomada rápida de decisões em tarefas como roteamento, classificação, verificação e controle de agentes. Diferente dos modelos de linguagem tradicionais, ele não escreve prosa: recebe uma entrada, um conjunto fixo de opções de resposta e devolve uma probabilidade calibrada para cada alternativa, em uma única chamada. A apresentação é feita como uma nova categoria de IA, pensada para produzir resultados que softwares podem executar imediatamente.
O modelo foi construído a partir do Qwen3.5-9B, modelo da Alibaba, que passou por um pós-treinamento específico para pontuação de decisões em uma única passagem. A contagem exata de parâmetros não foi divulgada. A janela de contexto é de 32.768 tokens, medida que indica quantos caracteres ou palavras o modelo consegue processar de uma vez. O acesso é feito apenas por API hospedada, no Microsoft Foundry e no OpenRouter via Azure, sem pesos abertos ou versões quantizadas.
Segundo o cartão do modelo no Foundry, documento oficial que descreve o comportamento da ferramenta, o sistema suporta perguntas de sim ou não, múltipla escolha, avaliação por notas, classificação e correção por critérios de respostas de IA e ações propostas por agentes. Também realiza checagens de fundamentação contra evidências fornecidas pelo usuário e inclui opções explícitas de abstenção, como "não é possível dizer". O treinamento usou conjuntos de dados públicos sob o processo Open Data da Microsoft, além de dados sintéticos, e a saída é entregue em JSON, formato estruturado de dados.
Nos testes de desempenho, a Microsoft comparou nove sistemas em 36 benchmarks, com 147.137 perguntas mantidas fora do treinamento. O Microsoft-Decision-1 alcançou a maior precisão média, de 83,5%, à frente do Quyet-1.0-Large, com 81,9%, do GPT-6 Luna Decisions, com 79,4%, e do H2O-Lightning-4B, com 77,2%. Em calibração, métrica que mede o quanto as probabilidades previstas refletem a realidade, ficou em 92,2, atrás apenas do Quyet-1.0-Large, que marcou 93,1. A latência mediana foi de 85 milissegundos, com p95 de 125 milissegundos, o que significa que 95% das respostas chegam abaixo desse tempo. Isso equivale a 4,5 vezes mais rapidez que o Quyet-1.0-Large e 35 vezes mais rápido que o GPT-6 Sol, que levou 3,01 segundos.
A empresa também avaliou robustez submetendo cada solicitação a oito tipos de perturbação, incluindo parafraseamento e embaralhamento das opções. O modelo mudou sua decisão em apenas 1,3% dos casos, com zero inversões quando as opções foram parafraseadas, invertidas ou reordenadas. Em segurança, foram executadas 5.250 solicitações em 11 benchmarks que cobrem conteúdo nocivo, tentativas de jailbreak e injeção de comandos. A Microsoft relatou recusas corretas com alta utilidade retida, mas sem publicar uma pontuação específica.
Resultados internos ilustram o uso do modelo em produção. Na Xbox Research, ele organizou mais de 10 mil itens de feedback 14 vezes mais rápido e 200 vezes mais barato que o GPT-6 Sol. No controle de qualidade do Copilot, ficou competitivo com o GPT5.6 Luna e foi 100 vezes mais veloz. Já no Microsoft Discovery, apresentou resultados 46 vezes mais consistentes que a pontuação por modelos de linguagem tradicionais, com o triplo da velocidade.
A comparação de latência, porém, é contestada. A Microsoft mediu o próprio modelo pelo Foundry, enquanto os números dos concorrentes vêm da mediana ajustada do JevBench. A H2O.ai afirma que essa metodologia dobra o tempo medido e soma 0,15 segundo, e que a mediana real de seu modelo é de 29 milissegundos, não os 210 milissegundos apontados. O Microsoft-Decision-1 não aparece no quadro oficial do JevBench, no qual o H2O-Lightning-4B lidera o ranking com pontuação composta de 72,5.
Para desenvolvedores, a implantação acontece no Microsoft Foundry como modelo "Direct from Azure" de disponibilidade geral. No OpenRouter, o modelo funciona pela API de decisões, e não pelo endpoint de chat, o que significa que as bibliotecas de conversação usuais não funcionam. O preço é de 0,042 dólar por milhão de tokens de entrada, com saída gratuita, contra 0,10 dólar por milhão cobrado pelo endpoint de decisões Luna, da OpenAI.
As limitações são explícitas no cartão do modelo: a ferramenta não serve para geração de texto, perguntas e respostas abertas, chat, tradução ou resumo; funciona apenas com texto, sem imagens, áudio ou vídeo; e não gera explicações sobre suas decisões. A Microsoft também proíbe seu uso como único decisor automático em questões de crédito, emprego, moradia, saúde ou direitos legais, exigindo que as aplicações definam opções, limiares, caminhos de escalonamento e supervisão humana.
O Microsoft-Decision-1 aposta em probabilidades calibradas no lugar de texto gerado, combina precisão de 83,5% nos benchmarks da própria Microsoft com latência mediana de 85 milissegundos e cobra apenas pela entrada dos dados. O ponto em aberto é que os pesos permanecem fechados, os testes foram conduzidos pelo próprio fabricante e as comparações de velocidade seguem disputadas. O anúncio oficial está disponível no site da Microsoft, e o modelo pode ser acessado pelo Microsoft Foundry e pelo OpenRouter.