Se o objetivo é gerar imagem IA local, rodando tudo na sua própria GPU, sem fila de nuvem e sem pagar por imagem, o fim de 2025 trouxe duas opções que mudaram essa conta: o Z-Image-Turbo do Tongyi Lab/Alibaba e o Qwen-Image-2.1 da linha QwenLM. Um é velocidade pura em GPU de consumo; o outro é recurso completo de geração e edição.

Neste guia vou destrinchar os requisitos de hardware de cada um, a instalação passo a passo no ComfyUI e via diffusers, e como expor isso numa API para automatizar com n8n. Também conto como isso roda na prática nas minhas máquinas aqui em Fortaleza.

Por que gerar imagem IA local virou viável: Z-Image-Turbo e Qwen-Image-2.1 mudaram o jogo

Gerar imagem IA local: guia prático com Z-Image-Turbo e Qwen - Imagem complementar

O Z-Image-Turbo, lançado em 26 de novembro de 2025, é uma variante destilada de 6B parâmetros da linha Z-Image, com arquitetura S3-DiT. A sacada principal: gera imagens em 8 passos, sem CFG, rodando em GPUs de consumo com 16GB de VRAM. Isso derrubou a barreira que antes exigia placa topo de linha ou nuvem.

A recepção foi imediata: o modelo passou de 500 mil downloads no primeiro dia e liderou o gráfico de tendências do Hugging Face. A licença é Apache 2.0, o que permite uso comercial sem royalties — detalhe que pesa muito pra quem pensa em produto, não só em hobby.

PUBLICIDADE

Já o Qwen-Image-2.1 é a versão mais recente da linha Qwen-Image e mira em outra frente: une geração e edição na mesma ferramenta, gera nativamente imagens transparentes (RGBA), monta foto de grupo a partir de seis retratos de referência e suporta proporções até 2752x1536. É mais canivete suíço do que bala de prata de velocidade.

Requisitos de GPU e RAM: o que roda na sua máquina (bf16, fp8 e GGUF)

Segundo o guia prático da Thunder Compute, os requisitos do Z-Image-Turbo variam bastante conforme a precisão escolhida, e é aqui que muita gente se engana ao avaliar se dá pra rodar ou não:

VarianteVRAMRAM
bf1614 a 16GB16GB
FP88GBnão informado
GGUF Q4/Q3até 6GB32GB recomendados

Além disso, conte com Python 3.10+, CUDA 12.x e cerca de 30GB de disco só pros arquivos. Ou seja: uma GPU de 8GB já entra no jogo com FP8, e até 6GB de VRAM é possível com GGUF, desde que a RAM do sistema acompanhe.

Vale lembrar que esses números são do Turbo, o modelo destilado. A versão base não destilada (Z-Image) usa 30 a 50 passos com CFG entre 3 e 5: mais lenta, porém com mais liberdade criativa e suporte a fine-tuning, como detalha o post do blog do ComfyUI sobre o modelo.

Instalando o Z-Image-Turbo no ComfyUI: arquivos, pastas e workflow oficial

O ComfyUI deu suporte nativo day-0 à família Z-Image, e existe tutorial oficial de workflow na documentação, o que facilita muito a vida de quem já usa a ferramenta.

O download oficial é feito direto do repositório, com o huggingface_hub atualizado:

pip install -U huggingface_hub
hf download Tongyi-MAI/Z-Image-Turbo

Depois de baixar, cada arquivo vai numa pasta específica da sua instalação do ComfyUI:

ArquivoPasta do ComfyUI
z_image_turbo_bf16.safetensorsdiffusion_models
qwen_3_4b (bf16/fp8/fp4)text_encoders
ae.safetensorsvae
LoRA de destilaçãoloras

Repare que o text encoder é o Qwen 3 4B — mesmo sendo um modelo da Alibaba concorrente "de linha", eles se complementam aqui. O modelo aceita prompts em inglês e chinês, incluindo renderização de texto misto chinês/inglês dentro da imagem.

Se você precisar de controle preciso de pose e composição, no início de dezembro de 2025 o Tongyi Lab abriu também o Z-Image-Turbo-Fun-Controlnet-Union, variante com ControlNet, igualmente em Apache 2.0. Está publicado no repositório deles no Hugging Face.

Qwen-Image-2.1 via diffusers: instalação, cpu offload e quando usar

O caminho recomendado pro Qwen-Image-2.1 é a biblioteca diffusers. As dependências listadas no model card são:

pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow

O diffusers, nessa configuração, é instalado via git — confira o comando exato no model card do modelo no Hugging Face, porque a forma de instalação pode mudar conforme a versão. Pra reduzir o consumo de VRAM, o próprio model card indica o offload:

pipe.enable_model_cpu_offload()

Como linha de base, conte com ~40 passos por imagem. É uma ordem de grandeza diferente dos 8 passos do Turbo, e isso reflete a filosofia de cada modelo.

Contexto importante pra calibrar expectativas: o Qwen-Image original, de 20B parâmetros, pedia cerca de 40GB de VRAM sem otimização, e ~58GB na variante Edit, segundo esse artigo da MindStudio. Localmente, ele só ficava viável com quantização e offload. O 2.1 segue sendo pesado, então o cpu offload não é opcional, é parte do setup.

Turbo ou Qwen? Escolhendo o modelo certo para cada tarefa

Essa escolha depende do seu caso de uso, e os fatos ajudam a decidir:

  • Volume e velocidade: Turbo. 8 passos sem CFG, em GPU de 8GB com FP8. Se você gera dezenas de imagens por dia, essa é a conta que fecha.
  • Edição, transparência e referências: Qwen-Image-2.1. Geração e edição juntas, RGBA nativo, foto de grupo a partir de seis retratos e proporções grandes até 2752x1536.
  • Fine-tuning e liberdade criativa: versão base Z-Image, com 30 a 50 passos e CFG 3 a 5.
  • Controle de pose e composição: Z-Image-Turbo-Fun-Controlnet-Union.

Na dúvida, comece pelo Turbo: é o mais barato de testar em hardware modesto, e a licença Apache 2.0 não trava nada. Se sentir falta de edição ou transparência, aí sim o Qwen-Image-2.1 entra na jogada.

Integração via API: chamando o ComfyUI pelo n8n para automatizar geração de imagens

Gerar imagem na interface é ótimo pra teste, mas o valor real aparece quando você automatiza. Workflows do ComfyUI podem ser executados via API com o SDK oficial (@comfyorg/sdk), usando API key e o workflow_api.json. Isso permite chamar a geração de imagens de qualquer backend, incluindo o n8n.

O fluxo geral fica assim: você monta e testa o workflow na interface, exporta a versão de API, e consome esse endpoint num fluxo do n8n — por exemplo, disparado por um formulário, um webhook ou uma planilha. A página de workflows do ComfyUI tem exemplos prontos que você pode usar de base.

Um detalhe que economiza tempo: o workflow_api.json não é o mesmo arquivo que você salva normalmente na interface. É a exportação específica de API, senão o endpoint não reconhece o formato.

Na prática: como uso isso aqui

Hoje tenho o Z-Image rodando nas minhas aplicações e gerando boas imagens. Uso mais pra gerar imagens pros blogs em formato 16:9, e os números no meu hardware: cerca de 20 segundos pra subir pra VRAM, e depois que já está na VRAM, cada imagem sai em torno de 9 a 10 segundos.

Testei a comparação com o Qwen, e a conclusão que cheguei: não me trouxe uma diferença muito grande em qualidade em relação ao Z-Image, mas o uso de VRAM aumentou muito. Optei por continuar com o Z-Image porque, como meu hardware é limitado, preciso de um padrão que dê pra rodar aqui junto o llama.cpp com o gerador de imagens — LLM e imagem dividindo a mesma máquina.

Sobre a integração via API: hoje temos a opção de usar o ComfyUI por esse caminho, mas o custo disso aumenta. No meu caso, que gero em média 60 imagens por dia, o custo ao mês, juntando com os demais custos, ficaria muito alto. Então opto por rodar localmente.

Pra quem usa poucas gerações por dia, a conta pode inverter: usar por API, pela OpenRouter ou outra opção. Minha indicação seria o muse-image, que custa cerca de US$ 0,01 por imagem, em vez de montar geração local. Mas aí vêm alguns critérios que devem ser pensados:

  1. Custo — local exige hardware que você já tem; API cobra por uso.
  2. Privacidade — local não envia nada pra fora.
  3. Disponibilidade — local roda sem internet.
  4. Desempenho — no meu caso, 9 a 10 segundos por imagem.

São esses fatores, entre outros, que devem ser ponderados na decisão entre geração local e API.

Perguntas frequentes

O Z-Image-Turbo roda em qual GPU?

Em bf16, ele pede 14 a 16GB de VRAM e 16GB de RAM. Com FP8, roda em 8GB de VRAM, e em GGUF Q4/Q3 chega a 6GB de VRAM, com 32GB de RAM recomendados. O setup também exige Python 3.10+, CUDA 12.x e ~30GB de disco.

Posso usar o Z-Image-Turbo comercialmente?

Sim. O modelo é licenciado em Apache 2.0, o que permite uso comercial sem royalties. A variante com ControlNet, Z-Image-Turbo-Fun-Controlnet-Union, segue a mesma licença.

Qual a diferença entre o Turbo e a versão base do Z-Image?

O Turbo é destilado: gera em 8 passos sem CFG, priorizando velocidade. A base usa 30 a 50 passos com CFG 3 a 5, sendo mais lenta, porém com mais liberdade criativa e suporte a fine-tuning.