Quem monta automação grande descobre rápido que o custo não vem do modelo mais inteligente, e sim de milhares de chamadas pequenas por dia. Classificar mensagem, extrair dados, responder cliente, resumir e rotear ticket são tarefas em que um modelo de US$ 0,10 por milhão de tokens entrega quase o mesmo resultado que um de US$ 3. Este guia reúne as opções mais baratas que ainda são boas em texto, imagem, transcrição (STT) e voz (TTS), com preços de 10/10/2026, e termina com o que eu mesmo uso no meu setup.
Aviso: preços de IA mudam toda semana. Os valores abaixo foram conferidos em 10/10/2026 na OpenRouter e nas páginas dos fabricantes. Confira antes de orçar. Os preços por milhão de tokens estão em dólar (US$).
Como escolher: o que importa além do preço
- Preço de entrada e de saída. Em agentes, a entrada pesa mais (histórico, instruções, catálogo). Em redação, pesa a saída.
- Contexto e cache. O prompt de sistema grande se repete a cada chamada. A leitura em cache costuma custar 10% da entrada.
- Chamada de ferramentas (tool calling) e JSON estruturado. Sem isso o agente quebra no n8n.
- Faixas de preço por tamanho do prompt. Vários modelos dobram ou quintuplicam o preço acima de 32K, 100K ou 272K tokens, para a requisição inteira.
- Tokens de raciocínio. Modelos com "thinking" cobram esses tokens como saída. Um modelo barato que pensa muito pode sair mais caro que um mediano que responde direto.
- Privacidade. Alguns provedores processam fora do país. Para dado de cliente, veja contrato e região.
Texto: os modelos baratos que valem o teste
| Modelo | Entrada / Saída (US$ por 1M de tokens) | Contexto | Destaque |
|---|---|---|---|
| Qwen3.7 Flash | 0,03 / 0,13 (até 32K) | 1M | O mais barato da lista. Sobe para 0,10 / 0,40 acima de 32K |
| GPT-5 nano | 0,05 / 0,40 | 400K | Veterano barato da OpenAI |
| Claude Haiku 5.5 | 0,10 / 0,50 (até 100K) | 1M | Lançado em 07/10/2026; forte em agentes |
| GPT-6 Luna | 0,10 / 0,50 (até 272K) | 1,05M | Lançado em 22/09/2026 |
| Gemini 2.5 Flash-Lite | 0,10 / 0,40 | 1M | Multimodal, estável, sem data de desligamento anunciada |
| JEV 1.13 (TypeSafe) | 0,042 / 0 | 64K | Classificador: devolve uma decisão tipada, não gera texto |
| Ministral 3B | 0,10 / 0,10 | 131K | Tarefas simples e volume enorme |
| Gemma 4 31B | 0,09 / 0,34 | 262K | Aberto; dá para rodar local |
| Gemini 3.1 Flash-Lite | 0,25 / 1,50 | 1M | Sucessor do 2.5 Flash-Lite |
| DeepSeek V4.1 Flash | 0,30 / 1,20 | 1M | Bom em código e raciocínio |
| Gemini 3.5 Flash-Lite | 0,30 / 2,50 | 1M | Recomendado pelo Google para projetos novos |
Qwen3.7 Flash: o campeão de preço
Custa US$ 0,03 de entrada e US$ 0,13 de saída até 32K tokens, com leitura em cache a US$ 0,006. Janela de 1M tokens e saída de até 65 mil tokens. Para classificação, extração e respostas curtas em alto volume, é difícil competir. Cuidados: o preço sobe acima de 32K (0,10 / 0,40) e acima de 256K (0,20 / 0,80), e a infraestrutura é da Alibaba, então avalie onde os dados são processados antes de mandar informação sensível de cliente.
Claude Haiku 5.5: o mais capaz entre os baratos
Preço de US$ 0,10 / 0,50 até 100K tokens. Acima disso, a requisição inteira passa a US$ 0,50 / 2,50. A leitura em cache custa US$ 0,01 e o batch tem 50% de desconto (US$ 0,05 / 0,25). Contexto de 1M e saída de até 128K.
- Em um teste independente com oito tarefas de código, passou de 4/8 (Haiku 4.5) para 8/8. É um teste pequeno, não um benchmark formal.
- A Artificial Analysis o colocou em 43 no índice de inteligência, à frente do Gemini 3.8 Flash (41).
- O tokenizador novo gera de 11% a 36% mais tokens para o mesmo texto que o Haiku 4.5. A economia real é menor que a do preço de tabela.
- O pensamento adaptativo vem ligado. Para resposta rápida em atendimento, use esforço
low. temperature,top_p,top_kebudget_tokensretornam erro 400. Se o seu fluxo do n8n mandatemperature, vai quebrar.- Taxa de alucinação medida em 40% no AA-Omniscience. Para atendimento, mantenha o agente preso a uma base de conhecimento.
- Fraqueza declarada: tarefas longas de terminal (Terminal-Bench 39%).
GPT-6 Luna: mesmo preço do Haiku, contexto de 1M
US$ 0,10 / 0,50 até 272K tokens; acima disso, US$ 0,20 / 0,75. A faixa só dobra a entrada, então é mais previsível que a do Haiku em prompts grandes. Tem versão batch pela metade do preço. Atenção ao nome: o GPT-5.6 Luna (julho) custa o dobro ou mais (US$ 0,20 / 1,20). Confira qual ID está no seu fluxo. Em uma comparação divulgada pela Anthropic, o Luna ficou atrás do Haiku 5.5 no GDPval (1437 contra 1620), então teste com as suas tarefas.
Gemini 2.5 Flash-Lite: o estável e multimodal
US$ 0,10 / 0,40, com leitura de imagem e áudio, e batch a US$ 0,05 / 0,20. A página oficial de depreciações do Google diz que ele "não está depreciado e continuará disponível até nova ordem", mas o Google já recomenda o 3.5 Flash-Lite ou o 3.8 Flash para projetos novos. Use onde já funciona e planeje a migração.
JEV (TypeSafe): o classificador rápido que não escreve texto
O JEV é diferente de todos os outros modelos desta lista. Ele pertence à família "System One" da TypeSafe e não gera texto: recebe um estado em texto (a mensagem do cliente, um JSON com contexto) e devolve uma decisão tipada com probabilidade. São três formatos: Choice (escolhe uma opção de uma lista, como a categoria de uma mensagem), Noul (responde sim ou não com uma probabilidade, como "o cliente pede reembolso?") e Score (dá uma nota em uma escala que você define, como o grau de irritação). Como a saída é um dado e não uma frase, o n8n consome direto, sem precisar interpretar texto ou validar JSON.
- Preço: US$ 0,042 por 1M de tokens de entrada e US$ 0 de saída (modelo
typesafe/jev-1.13na OpenRouter). Contexto de 64K. - Custo na prática: classificar 1.000 mensagens por dia, com cerca de 600 tokens cada, dá em torno de 0,6M de tokens por dia, ou ≈ US$ 0,75 por mês. No meu caso, uma classificação sai por cerca de US$ 0,000024.
- Velocidade: é o motivo de muita gente usar. Como a resposta é só a decisão, sem texto gerado, vem muito rápida, e perguntas extras na mesma chamada quase não aumentam o tempo, porque rodam em paralelo. A documentação da TypeSafe cita um exemplo com 13 perguntas em uma só chamada: 11,5 vezes mais barato e 9,6 vezes mais rápido que 13 chamadas separadas, com as mesmas respostas. Esse é um número da documentação do fabricante, não uma medição minha.
- Confiança: cada resposta traz probabilidades, e o código decide o que fazer. Acima de um limite você age sozinho; abaixo, manda para um modelo maior ou para uma pessoa. Cada limite precisa ser calibrado com os seus dados.
- Limites: só entende texto (sem imagem nem áudio, por enquanto) e não redige respostas, não escreve código e não explica o raciocínio. Em um agente de atendimento ele classifica e roteia; quem redige a resposta é um modelo como o Haiku 5.5 ou o Luna.
O padrão que funciona bem no n8n: o JEV classifica a mensagem (dúvida, compra, entrega, negociação...), um nó de código aplica as suas regras de desempate, e só então o fluxo chama o modelo de texto, com a instrução certa para aquela categoria. Isso evita pagar um modelo de linguagem para uma tarefa que um classificador resolve por uma fração do custo.
Nota de honestidade: não medi a latência do JEV diretamente. Uso ele em produção nos meus classificadores e a velocidade é visivelmente alta, mas o que está acima sobre desempenho vem da documentação do fabricante e de relatos de uso. Teste com as suas mensagens antes de colocar em produção, como em qualquer modelo.
Outros que merecem menção
- GPT-5 nano (0,05 / 0,40): o mais barato dos grandes provedores para texto simples.
- Ministral 3B / 8B (0,10 / 0,15): roteamento e classificação trivial.
- Gemma 4 31B (0,09 / 0,34) e Gemma 4 26B (0,0675 / 0,225): abertos, com versão gratuita limitada na OpenRouter, e podem rodar na sua máquina.
- DeepSeek V4.1 Flash (0,30 / 1,20): sobe um degrau de qualidade, com cache muito barato (US$ 0,006).
Quanto isso custa na prática
Cenário: um agente de atendimento com 1.000 conversas por dia, cada uma com 3.000 tokens de entrada (instruções, histórico, catálogo) e 500 de saída. São 3 milhões de tokens de entrada e 0,5 milhão de saída por dia.
| Modelo | Por dia | Por mês (30 dias) |
|---|---|---|
| Qwen3.7 Flash | US$ 0,16 | ≈ US$ 4,70 |
| GPT-5 nano | US$ 0,35 | ≈ US$ 10,50 |
| Gemini 2.5 Flash-Lite | US$ 0,50 | ≈ US$ 15 |
| Claude Haiku 5.5 / GPT-6 Luna | US$ 0,55 | ≈ US$ 16,50 |
| Gemini 3.1 Flash-Lite | US$ 1,50 | ≈ US$ 45 |
| DeepSeek V4.1 Flash | US$ 1,50 | ≈ US$ 45 |
Com cache de prompt (instruções fixas pagas a 10%) e batch (50%) para o que não é urgente, esses números caem bastante. Para comparar, o Haiku 4.5, antecessor, custava US$ 1 / 5: a mesma carga ficaria perto de US$ 165 por mês.
A conclusão é que, em alto volume, a diferença entre o mais barato e o intermediário é de dezenas de dólares por mês, e não de centenas. Pague um pouco mais quando um erro custar mais que a diferença.
Imagem: custo por imagem
Os preços abaixo são por imagem de 1K (cerca de 1 megapixel). Os valores do Google e da OpenAI são oficiais ou calculados a partir do preço oficial por token. Para os demais, a OpenRouter cobra por token de imagem e eu estimei o valor por imagem a partir dele (cerca de 4.175 tokens por imagem 1K, número que reproduz exatamente os US$ 0,01 da Meta e os US$ 0,03 e US$ 0,04 da Alibaba).
Os dois mais usados: OpenAI e Google
| Modelo | Qualidade / tamanho | Custo por imagem |
|---|---|---|
| GPT Image 2 (OpenAI) | Baixa, 1024×1024 | ≈ US$ 0,006 |
| Média, 1024×1024 | ≈ US$ 0,053 | |
| Alta, 1024×1024 | ≈ US$ 0,211 | |
| Retrato ou paisagem (baixa / média / alta) | US$ 0,005 / 0,041 / 0,165 | |
| GPT Image 2.5 Flare / Sunburst | Mesmo preço entre si (US$ 30 por 1M de tokens de imagem) | de ≈ US$ 0,006 (baixa) a ≈ US$ 0,21 (máxima) |
| Nano Banana 2.1 (Gemini, lançado em 06/10/2026) | 1K / 2K / 4K | US$ 0,034 / 0,050 / 0,076 |
| Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image) | Somente 1K | US$ 0,034 (batch: US$ 0,017) |
| Nano Banana 2 (Gemini 3.1 Flash Image) | 1K / 2K / 4K | US$ 0,067 / 0,101 / 0,151 |
| Nano Banana Pro (Gemini 3 Pro Image) | 1K–2K | ≈ US$ 0,13 |
As faixas de baixa, média e alta do GPT Image 2 são estimativas da calculadora da própria OpenAI, não um preço de tabela, porque a cobrança é por token. Prompt e imagens de referência são cobrados à parte, e editar com imagem de referência custa um pouco mais que gerar do zero. O Batch da OpenAI e o do Google dão 50% de desconto se você aceitar esperar até 24 horas.
Qual é o custo médio de uma imagem
| Uso | Faixa de custo médio |
|---|---|
| Capa de blog ou post (GPT Image 2 em qualidade média ou Nano Banana 2.1 em 1K) | US$ 0,03 a US$ 0,05 |
| Volume alto (Nano Banana 2 Lite ou GPT Image em qualidade baixa) | US$ 0,006 a US$ 0,034 |
| Alta fidelidade (GPT Image em qualidade alta, Nano Banana 2 em 4K) | US$ 0,15 a US$ 0,21 |
Em 1.000 imagens por mês, o GPT Image 2 em qualidade média custa cerca de US$ 53, o Nano Banana 2.1 em 1K custa US$ 34 e o Muse Image custa US$ 10.
As alternativas mais baratas
| Modelo | Preço por imagem (1K) | Observação |
|---|---|---|
| Recraft V4.1 Flash | ≈ US$ 0,007 | Rápido (cerca de 1,5 s) |
| Tencent Hy Image 3.5 (preview) | ≈ US$ 0,007 | Gera e edita, aceita até 20 referências |
| Meta Muse Image | US$ 0,01 (preço oficial) | "Agêntico": raciocina e pesquisa na web antes de renderizar |
| Krea 2 Medium Turbo | ≈ US$ 0,015 | Foco em iteração rápida |
| Seedream 5.0 Flash | ≈ US$ 0,018 | Camada de alto volume da ByteDance |
| Qwen Image 3 | ≈ US$ 0,03 | Texto nítido e detalhes de até 10 px; gera e edita |
| Qwen Image 3 Pro | ≈ US$ 0,04 (1K) / US$ 0,075 (2K) | Mais conhecimento de mundo |
Muse Image (Meta). Chegou à API em 28/08/2026 por US$ 0,01 por imagem, com o mesmo preço quando se usa raciocínio alto ou ferramentas. Aceita texto e imagens de referência (geração e edição). Na OpenRouter aparece como versão de avaliação (muse-image-1.0-eval), então espere mudanças. Ótimo custo-benefício para volume.
Qwen Image 3. Gera e edita, aceita até 4 imagens de referência, proporções de 1:1 até 4:1, 1K ou 2K, e produz de 1 a 6 imagens por chamada. É a melhor aposta quando a imagem tem texto escrito (banners, posts, cartazes). Para a maioria dos casos você não precisa do 3 Pro.
E o Qwen Image 2.1? Os pesos são abertos, mas com licença de pesquisa: uso comercial exige autorização à parte. Algumas hospedagens revendem a US$ 0,02 (1K) a US$ 0,04 (2K), mas não achei um preço oficial confiável, e o 3 já cobre o mesmo uso. Para produção, prefira o 3.
Quando pagar mais. O GPT Image 2 e os Nano Banana são os mais usados hoje porque seguem bem instruções longas, renderizam texto e mantêm consistência na edição. Para uma capa de blog, a diferença para o Muse Image ou o Qwen Image 3 muitas vezes não justifica 3 a 5 vezes o preço. Faça o teste com 10 prompts reais e escolha pela sua régua, não pela popularidade.
Áudio: transcrição (STT)
O padrão é cobrar por segundo ou por minuto de áudio.
| Modelo | Preço aproximado | Observação |
|---|---|---|
| Whisper Large v3 Turbo | ≈ US$ 0,012 por hora | O mais barato; vários provedores |
| Whisper Large v3 | ≈ US$ 0,027 por hora | Mais preciso em sotaques e ruído |
| Voxtral Mini Transcribe (Mistral) | US$ 0,003 por minuto | Multilíngue |
| Muse Voice Transcribe (Meta) | US$ 0,003 por minuto | |
| GPT-4o mini Transcribe | ≈ US$ 0,003 por minuto | Cobrança por token |
| GPT Transcribe | ≈ US$ 0,0045 por minuto | |
| Whisper-1 / Fish Transcribe | US$ 0,006 por minuto | |
| Deepgram Nova-3 | ≈ US$ 0,0077 por minuto | Streaming de baixa latência |
| AssemblyAI Universal-Streaming | ≈ US$ 0,0025 por minuto |
Para áudio de WhatsApp (mensagens de voz de clientes), o Whisper Large v3 Turbo é imbatível no preço: uma hora de áudio custa centavos. Se o sotaque ou o ruído atrapalham, suba para o Whisper v3 completo ou o Voxtral. Para ligações em tempo real, escolha um serviço de streaming (Deepgram ou AssemblyAI).
Áudio: voz (TTS)
Aqui o preço costuma ser por caractere, em US$ por 1 milhão de caracteres. Como referência, 1 minuto de fala tem cerca de 900 caracteres. Por isso US$ 15 por 1M de caracteres equivale a ≈ US$ 0,0135 por minuto.
| Modelo | Preço | Observação |
|---|---|---|
| Gemini 3.8 Flash-Lite TTS | ≈ US$ 0,009 por minuto (estimado: tokens de áudio a US$ 6 por 1M) | Controle de estilo por prompt |
| Qwen Audio 3.0 TTS Flash | US$ 15 por 1M de caracteres | Versão Plus: US$ 20 |
| Fish Audio S2.1 Pro | US$ 15 por 1M de caracteres | Existe versão gratuita limitada |
| Grok Voice TTS | US$ 15 por 1M de caracteres | |
| Voxtral Mini TTS (Mistral) | US$ 16 por 1M de caracteres | |
| Deepgram Flux TTS | US$ 45 por 1M de caracteres | Baixa latência para voz ao vivo |
| Inworld TTS-2 Flash | ≈ US$ 0,007 por minuto | O mais barato por minuto em agosto de 2026 |
| Google Cloud / Amazon Polly (padrão) | US$ 4 por 1M de caracteres | Voz mais robótica |
| ElevenLabs Flash v2.5 | ≈ US$ 0,05 por minuto | Expressiva e mais cara |
| Kokoro-82M | Grátis (roda local) | Você paga só o computador |
Teste em português do Brasil antes de decidir. O preço de tabela não mostra sotaque, pronúncia de nomes nem ritmo. Gere 10 frases reais do seu negócio em 3 vozes e ouça.
Que modelo usar em cada tarefa
| Tarefa | Escolha |
|---|---|
| Classificar mensagem, rotear ticket, extrair campos | Qwen3.7 Flash, GPT-5 nano ou JEV |
| Ler foto ou print e classificar | Gemini 2.5 Flash-Lite |
| Atendimento ao cliente com ferramentas (agente) | Claude Haiku 5.5 ou GPT-6 Luna |
| Textos longos de blog e resumos de documento | Haiku 5.5 em batch ou DeepSeek V4.1 Flash |
| Código e fluxos complexos | DeepSeek V4.1 Flash ou subir para um modelo maior |
| Capas e posts com imagem | Muse Image, Qwen Image 3 ou Nano Banana 2.1 |
| Imagem com texto | Qwen Image 3 ou GPT Image 2 |
| Áudio do WhatsApp | Whisper Large v3 Turbo |
| Voz de atendimento | Gemini 3.8 Flash-Lite TTS ou Qwen TTS Flash |
Dicas para o n8n: onde se economiza de verdade
- Use um gateway. Um único endpoint (LiteLLM ou OpenRouter) permite trocar de modelo sem mexer em dezenas de fluxos e configurar fallback automático para outro modelo quando um cair.
- Prompt fixo no começo, parte variável no fim. É assim que o cache funciona; a leitura em cache custa cerca de 10% da entrada.
- Batch para o que não é urgente. Relatórios, classificação em lote e geração de conteúdo à noite pela metade do preço.
- Saída estruturada. Use
response_formatcom JSON Schema em vez de pedir JSON no texto do prompt. Prompts longos com instruções extras degradam o formato. - Limite o
max_tokense o esforço de raciocínio. Modelos com thinking podem gastar a saída inteira pensando e devolver texto vazio. - Meça antes de publicar. Rode de 8 a 12 rodadas com os seus casos reais e conte os acertos. Benchmark público não substitui isso.
- Defina um teto de gasto. Configure limite diário na conta. Um loop mal feito no n8n gasta o orçamento de um mês em uma noite.
- Dado de cliente. Prefira provedores com contrato de privacidade e, para o que é muito sensível, um modelo aberto rodando local.
Perguntas frequentes
O mais barato é sempre o melhor? Não. Para classificação sim; para atendimento com ferramentas, o erro de um modelo fraco custa mais que a economia. Comece barato, meça e suba só onde falha.
Posso misturar modelos? Deve. Um modelo barato classifica e roteia; um intermediário responde só quando necessário.
Esses preços vão cair? Provavelmente. O Haiku 5.5 custa um décimo do Haiku 4.5, lançado há menos de um ano. Revise o orçamento a cada trimestre.
Conclusão
Em outubro de 2026, um agente de atendimento com 1.000 conversas por dia pode custar menos de US$ 20 por mês. O Qwen3.7 Flash ganha no preço puro, o Claude Haiku 5.5 e o GPT-6 Luna entregam mais capacidade para agentes com ferramentas, e o Gemini 2.5 Flash-Lite continua ótimo para visão. Em imagens, o Muse Image (US$ 0,01) e o Qwen Image 3 (US$ 0,03) cobrem quase todo uso editorial; o Nano Banana 2.1 (US$ 0,034) e o GPT Image 2 em qualidade média (≈ US$ 0,053) são os mais usados e valem quando você precisa de mais fidelidade ou edição. Em áudio, o Whisper Large v3 Turbo para transcrever e o Gemini Flash-Lite TTS ou o Qwen TTS Flash para falar.
Como eu uso isso no meu setup hoje
Tudo que li e testei acima virou uma regra simples no meu dia a dia: o que é privado fica local, e o que não tem restrição vai para a nuvem mais barata.
Texto
- Local, para dados privados: Qwen3.5 9B e Gemma 4 12B rodando na minha máquina. Tudo que envolve dado de cliente, conversa ou informação interna passa só por eles. O custo é zero e nada sai da minha rede.
- Nuvem, para o que não tem restrição de privacidade: Claude Haiku 5.5, GPT-6 Luna e Gemini 2.5 Flash-Lite. Uso quando quero aliviar o fluxo local: textos públicos, resumos de conteúdo aberto, tarefas em lote e momentos em que o modelo local ficaria lento ou ocupado. Por serem os mais baratos que ainda se saem bem, o custo mensal é de poucos dólares, como mostra a tabela de custos acima.
- Classificação: JEV. Todas as mensagens de clientes passam primeiro por ele para ser classificadas (dúvida, compra, entrega, negociação etc.), pela rapidez, pelo custo de centavos por mês e pela precisão. Só depois um modelo de texto responde.
Imagem
- Local, para privacidade: Z-Image Turbo. Fotos de produto, material interno e qualquer coisa que eu não queira enviar a terceiros.
- Nuvem, para o resto: Muse Image. Para imagens variadas sem restrição, é o que entrega a melhor relação entre qualidade e custo: US$ 0,01 por imagem, com resultado excelente na minha experiência.
Áudio (STT e TTS)
- Tudo local. Áudio de cliente é dado pessoal, e o modelo local resolve com custo zero.
- Transcrição (STT): uso o Whisper Large v3 Turbo e o Qwen3-ASR 1.7B. Os dois rodam na minha máquina.
- Voz (TTS): uso o Qwen3-TTS 1.7B, também local.
- Só trocaria por uma API se precisasse de uma voz muito específica ou de latência de ligação em tempo real.
A regra que sigo para decidir
| Pergunta | Se sim | Se não |
|---|---|---|
| O conteúdo tem dado de cliente ou informação interna? | Modelo local | Vou para a pergunta seguinte |
| O fluxo local está sobrecarregado ou o modelo local é fraco para a tarefa? | API barata (Haiku 5.5, Luna ou Flash-Lite) | Fica local |
| A tarefa é de imagem sem restrição? | Muse Image | Z-Image Turbo local |
O que eu recomendo a quem está começando: comece pelo local para ver se atende e use a API só onde o local falha ou onde a privacidade não é problema. Assim a conta fica baixa e você não depende de um único fornecedor.