Fireworks AI lança Ember-1, versão otimizada do Kimi K3 com 40% menos tokens

A Fireworks AI anunciou o lançamento do Ember-1, modelo especializado desenvolvido pela Fireworks Research a partir do pós-treinamento do Kimi K3, modelo de pesos abertos da Moonshot AI. A proposta central é entregar a mesma qualidade do K3 consumindo cerca de 40% menos tokens, sem recorrer ao simples rebaixamento do nível de esforço de raciocínio no momento da inferência. Em outras palavras, o modelo aprende a pensar de forma mais enxuta em vez de simplesmente pensar menos.

Segundo a empresa, o Ember-1 foi treinado para produzir cadeias de raciocínio mais curtas, preservando a precisão nas tarefas. O modelo é o primeiro de uma série de modelos especializados da Fireworks Research e está disponível exclusivamente como Research Preview por meio da API serverless da Fireworks. Os pesos, o código de treinamento e os algoritmos exatos utilizados não foram publicados, o que impede a hospedagem própria por parte dos clientes neste momento.

Ember-1: a IA da Fireworks que aprendeu a pensar mais enxuto e corta 40% dos tokens sem perder qualidade - Imagem complementar

A motivação para o projeto veio de uma queixa recorrente dos usuários. Modelos de raciocínio, como o próprio Kimi K3, podem gastar mais de 90% dos tokens gerados apenas em raciocínio interno, etapa em que o modelo trabalha para chegar à resposta antes de produzi-la de fato. Esse custo se multiplica em cargas de trabalho agênticas com múltiplos turnos, situação em que cada nova chamada ao modelo precisa receber como contexto o raciocínio anterior.

O contexto cresce de forma aproximadamente quadrática com o número de turnos, fazendo com que traços longos de etapas iniciais sejam relidos e cobrados repetidamente nas chamadas seguintes. Os clientes da Fireworks queriam manter a capacidade de programação do K3, porém a um custo menor. Diminuir o esforço de raciocínio do modelo não resolvia o problema, pois comprometia a qualidade das respostas. A solução foi ensinar o modelo a raciocinar de maneira mais eficiente.

PUBLICIDADE

Para construir o Ember-1, a equipe da Fireworks Research partiu do princípio de que nem todo o raciocínio do K3 é desperdício. Algumas etapas, como revisitar uma hipótese ou reagir a um retorno, são formas úteis de autorreflexão. O objetivo do treinamento foi preservar esse comportamento e, ao mesmo tempo, eliminar redundâncias e loops improdutivos. A coleta de treinamento abrangeu matemática, programação, seguimento de instruções, conversação, busca, uso de ferramentas e engenharia de software.

A empresa afirma ter realizado mais de 50 experimentos de treinamento e conduzido mais de 200 avaliações. Também desenvolveu novos algoritmos de treinamento, que ainda não foram divulgados. Todo o processo foi executado sobre a plataforma Serverless Training da própria Fireworks, utilizando exclusivamente dados próprios e nenhum dado de clientes.

Nos benchmarks publicados pela Fireworks, o Ember-1 foi comparado ao Kimi K3 em três níveis de esforço de raciocínio. No Terminal Bench 2.1, o Ember-1 alcançou 82,0%, superando os 80,9% do K3 Max. No DeepSWE 1.1, o modelo chegou a 75,2%, também acima do K3 Max, que obteve 66,4%. Já no SWE-bench Verified, o Ember-1 ficou ligeiramente atrás, com 92,2% contra 93,2% do K3 Max, e no SWE-Interact registrou 20,0% diante dos 21,3% do K3 Max.

A redução de tokens nesses cenários variou entre 15% e 51%, com economia em dólares proporcional. Além dos benchmarks públicos, a Fireworks destaca o desempenho no Bedside Bench da Doximity, conjunto de 500 casos clínicos validados por médicos, no qual o Ember-1 estabeleceu uma nova fronteira de custo por tarefa dentro do Specialized Intelligence Index, métrica criada pela própria empresa.

A Fireworks também conduziu testes A/B com dois clientes em cargas reais de programação em produção, comparando o modelo com o K3 em condições idênticas de uso. Os dois relatos indicam cerca de 35% menos tokens por tarefa com qualidade equivalente. Na rodada publicada, os tokens de saída caíram de 49,3 mil para 29,9 mil por tarefa. Os tokens dedicados ao raciocínio diminuíram 71,3% e o total de tokens caiu 39%.

A pontuação da tarefa permaneceu praticamente estável, passando de 0,751 no K3 para 0,753 no Ember-1, enquanto o número médio de etapas por interação recuou de 23,8 para 21,4. Um dos clientes já opera o Ember-1 em produção. O preço do Ember-1 é o mesmo praticado para o Kimi K3 na plataforma da Fireworks: 3 dólares por milhão de tokens de entrada, 0,30 dólar por milhão de tokens de entrada em cache e 15 dólares por milhão de tokens de saída.

Como a tarifa por token é idêntica, toda a economia obtida pelos usuários vem da geração de um número menor de tokens. Por se tratar de um Research Preview, o acesso inicial é restrito à API serverless da própria Fireworks, sem possibilidade de execução on-premises enquanto pesos, código e algoritmos de treinamento não forem liberados publicamente.