A StepFun lançou em 20 de setembro de 2026 o Step 5 Preview, seu novo modelo principal para trabalho com agentes, com foco em engenharia de software e tarefas profissionais, com destaque para finanças. Desde 8 de outubro ele também está disponível na OpenRouter. Este guia reúne o que a documentação e as fontes dizem, o que ainda é só alegação da empresa e como testar com custo baixo. Os dados foram consultados em 10/10/2026.

Atenção: quase todos os benchmarks abaixo são divulgados pela própria StepFun. Não há relatório técnico nem avaliação independente completa. Trate os números como indicação, e não como veredito.

O que é o Step 5 Preview

  • Arquitetura: mistura esparsa de especialistas (MoE), com 600 bilhões de parâmetros no total e 27 bilhões ativos por token (cerca de 4,5%). Só uma fração dos pesos trabalha a cada token, o que reduz o custo de execução.
  • Contexto: 1 milhão de tokens, com saída de até 64 mil.
  • Entrada: texto, imagens (até 60 por requisição) e vídeo. A saída é só texto.
  • Raciocínio: parâmetro reasoning_effort com os níveis low, medium e high.
  • Recursos de API: chamada de ferramentas (tool calling), streaming, JSON Mode e JSON Schema, e cache de prompt.
  • Disponibilidade: API da StepFun (step-5-preview) e OpenRouter (stepfun/step-5-preview, servido só pela StepFun em fp8). O nome "Preview" indica versão em avaliação, sujeita a mudanças.
  • Licença: proprietário por enquanto. A StepFun prometeu abrir os pesos em 15 de outubro de 2026, sem informar a licença.

Quanto custa

PUBLICIDADE
ItemPreço por 1M de tokens
Entrada (sem cache)US$ 1,00
Entrada com cacheUS$ 0,05
Saída (inclui o raciocínio)US$ 2,70

O custo de saída conta os tokens de raciocínio. Isso importa porque o Step 5 é verboso: na Artificial Analysis ele gerou 160 milhões de tokens de saída para completar o índice, contra uma mediana de 82 milhões. Uma tarefa completa do índice custou cerca de US$ 1,03. A velocidade medida foi de 87 tokens por segundo, e o primeiro token chega em 2,8 segundos.

Um exemplo simples: uma tarefa de código com 20 mil tokens de entrada e 8 mil de saída (com raciocínio) custa cerca de US$ 0,04. Em volume alto isso pesa. Comparado aos modelos baratos de fluxo, como o Claude Haiku 5.5 (US$ 0,10 / 0,50) e o Gemini 2.5 Flash-Lite (US$ 0,10 / 0,40), o Step 5 é dez vezes mais caro. Ele não é uma opção de classificação em massa. A comparação certa é com os modelos de agentes e de código. Veja o guia das APIs de IA mais baratas para a faixa econômica.

O que os benchmarks dizem

A StepFun testou o Step 5 em esforço alto, e os concorrentes em esforço máximo. Os números abaixo são da própria empresa.

Código e agentes

BenchmarkStep 5GLM 5.3Kimi K3GPT-6 AstraClaude Opus 5
DeepSWE v1.167,766,967,574,174,0
Terminal-Bench v433,341,912,657,952,3
ProgramBench80,572,077,885,482,3

Finanças, ciência e pesquisa na web

BenchmarkStep 5GLM 5.3Kimi K3GPT-6 AstraClaude Opus 5
FrontierFinance66,464,162,655,069,7
GPQA Diamond93,5%91,7%93,5%96,1%93,2%
BrowseComp88,7%n/d91,2%91,5%90,2%

Em negrito, o melhor resultado de cada linha. Em poucas palavras: DeepSWE e ProgramBench medem programação e engenharia de software; o Terminal-Bench mede tarefas executadas no terminal; o FrontierFinance, trabalho de finanças; o GPQA Diamond, perguntas de ciência em nível de pós-graduação; e o BrowseComp, pesquisa na web.

Como ler esses números:

  • Em código, o Step 5 fica no nível do GLM 5.3 e do Kimi K3 (DeepSWE) e atrás do GPT-6 Astra e do Claude Opus 5, como era de se esperar.
  • No Terminal-Bench, que mede trabalho no terminal, ele perde para o GLM 5.3 e para os dois modelos de ponta. Para agentes de linha de comando, é um ponto fraco.
  • Parte dos benchmarks da StepFun foi criada pela própria empresa, como o StepCodeBench (49,0, contra 40,2 do GLM 5.3 e 43,9 do Kimi K3).
  • Na Artificial Analysis, uma avaliadora independente, o índice de inteligência é 44 (versão 4.3.2), na posição 40 de 227 modelos.
  • É fraco em trabalho multimodal com documentos (14,8%, contra 31,0% do GPT-6 Astra).

A StepFun também afirma custar cerca de 65% menos que o GLM 5.3 e o Kimi K3 na mesma faixa de inteligência. Isso vem de um gráfico da própria empresa e não foi verificado de forma independente.

Como testar com custo baixo

1. Pela OpenRouter, com o modelo stepfun/step-5-preview:

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepfun/step-5-preview",
    "messages": [{"role": "user", "content": "Crie um jogo Doom simples em Three.js, em um único arquivo HTML."}],
    "reasoning": {"effort": "medium"},
    "max_tokens": 16000
  }'

2. Escolha o esforço com critério. Como os tokens de raciocínio são cobrados como saída, comece em low ou medium e só suba para high se a tarefa exigir. Defina sempre max_tokens, porque um modelo verboso pode gastar muito antes de responder.

3. Aproveite o cache. A entrada em cache custa 5% do preço normal. Em agentes com um prompt de sistema grande e repetido, isso derruba o custo.

4. Camada gratuita. Segundo a documentação da StepFun, citada por uma das fontes, há uma camada gratuita (V0) com 5 requisições simultâneas e 10 por minuto, útil para uma avaliação inicial.

Exemplo de uso: gerar jogos com um comando reutilizável

O vídeo que motivou este texto usa o Step 5 para gerar jogos prontos, e a técnica serve para qualquer modelo. O apresentador mantém um prompt genérico guardado em um comando com argumentos: ele digita o comando "criar jogo" e informa o jogo e a tecnologia (por exemplo, "Mario Kart" e "Three.js"), e o comando monta o prompt completo substituindo as palavras-chave. Isso padroniza as exigências e permite comparar modelos com o mesmo pedido.

O que o apresentador observou (impressões dele, não medições):

  • Doom: rodou de primeira, com movimento de arma convincente, mas com portas orientadas na direção errada e uma serra elétrica que atirava. O modelo corrigiu sozinho depois de rodar os próprios testes e conseguiu passar pelas portas.
  • Resident Evil (em Three.js): o melhor resultado que ele já viu nesse tipo de teste, com colisão boa e um bug de tiro para cima.
  • Mario Kart: jogável, mas com controle invertido ao virar. Ele considerou melhor que as versões anteriores.
  • Crash: funcionou, mas as fases eram idênticas e sem inimigos novos.

Vale ler isso como um teste informal. Ele mostra que o modelo gera jogos completos em um único pedido e se corrige quando consegue rodar testes. Não mede a qualidade de código em um projeto real.

E rodar local?

Hoje (10/10/2026) o quadro é este:

  • Pesos oficiais: prometidos para 15 de outubro. Na data desta consulta, a StepFun não havia publicado repositório oficial nem licença.
  • Cuidado com cópias: existem repositórios no Hugging Face com nomes como "Step-5-Preview-BF16", "GGUF" e "NVFP4", criados antes da data oficial, de contas sem relação confirmada com a StepFun. Não baixe nem rode nada disso. Espere o repositório oficial.
  • Tamanho: pelo número de parâmetros, 600B exigem cerca de 1,2 TB em BF16 (estimativa de fonte secundária), algo na casa de 600 GB em FP8 e de 300 GB em 4 bits (cálculo aproximado, sem contar o cache de contexto). Não cabe em uma máquina comum, e com 27B ativos a velocidade será baixa sem memória rápida suficiente.
  • Ferramentas de inferência (versões em 10/10/2026): vLLM v0.31.0 (05/10), SGLang v0.5.21 (02/10), llama.cpp v0.6.0 (05/10) e Ollama v0.40.2 (08/10). Os materiais do modelo citam vLLM e SGLang, mas o suporte ao Step 5 em qualquer uma delas ainda não está confirmado. No llama.cpp existem relatos de uso da família anterior (Step-3.7-Flash), mas nada sobre o Step 5. Confirme nas notas de versão depois de 15 de outubro.

Limitações e pontos de atenção

  • Preview: a versão pode mudar, e o preço também.
  • Verbosidade: comentários de usuários apontam que o modelo "raciocina demais e por muito tempo", o que encarece a saída.
  • Benchmarks sem confirmação independente: parte deles é da própria StepFun, com esforço diferente do dos concorrentes.
  • Sem relatório técnico até agora.
  • Um único provedor: na OpenRouter, só a StepFun serve o modelo, então não há alternativa de provedor nem de preço.

Conclusão

O Step 5 Preview é um modelo competitivo para agentes de código e trabalho profissional, no nível do GLM 5.3 e do Kimi K3 nos benchmarks da própria StepFun, por um preço intermediário (US$ 1 / 2,70). Ele não substitui os modelos baratos de fluxo e atendimento, e não é o melhor em terminal. Vale testar na API com esforço baixo e max_tokens definido, e esperar o 15 de outubro para saber a licença e se dá para rodar local.

Fontes