Google lança Gemini Omni 1.1 Flash com controle de cena de até 40 segundos e upscaling para 4K

O Google disponibilizou nesta semana o Gemini Omni 1.1 Flash, atualização de produção do seu modelo nativo de geração e edição de vídeo com múltiplas modalidades. O lançamento transforma o Omni de um gerador de clipes em uma ferramenta direcionável, com novos mecanismos para controlar continuidade de cenas, movimentos de câmera, consistência de personagens e custo de renderização.

Google eleva a geração de vídeo por IA a outro nível: Gemini Omni 1.1 Flash chega com cenas de até 40 segundos, controle cinematográfico e upscaling em 4K - Imagem complementar

A principal mudança está na extensão de cenas. Antes, o modelo analisava apenas o último frame de um vídeo ao continuar uma sequência. Agora, o Omni 1.1 Flash é capaz de ler até dez segundos de contexto prévio. Cada extensão opera em incrementos de dez segundos e pode acumular um total de até 40 segundos, com o modelo gerando de três a dez segundos de continuação por chamada. A função anexa trechos apenas ao final do clipe, sem permitir inserções no meio ou no início.

PUBLICIDADE

Outra adição é a interpolação por quadros-chave. O usuário pode fixar o primeiro e o último frame de uma cena, e o modelo gera o vídeo contínuo entre eles. Esse mecanismo habilita movimentos de câmera específicos, como órbitas e dolly-zooms, além de loops sem costura. Para organizar as instruções, a API utiliza tags que vinculam mídias a funções, como , , e . As referências em vídeo aceitam até três clipes, com duração máxima de três segundos cada, e são indicadas especialmente para preservar a aparência de personagens. O áudio presente em vídeos de referência é ignorado pelo sistema.

O controle de custos também foi repensado. O parâmetro de resolução na resposta da API aceita 360p, 720p como padrão, 1080p e 4K, sendo as duas últimas obtidas por upscaling. Segundo o Google, os rascunhos em 360p podem ser gerados até 60% mais rápido e a um terço do custo da versão 720p, considerando a vazão do sistema. A lógica recomendada para produção é iterar economicamente em baixa resolução e renderizar a versão final uma única vez em alta definição.

A precificação é definida por tokens. A entrada custa 1,50 dólar por milhão de tokens para texto, imagem, vídeo e áudio combinados. A saída tem valores distintos: 9,00 dólares por milhão de tokens de texto e 17,50 dólares por milhão de tokens de vídeo. A cobrança de vídeo considera 5.792 tokens por segundo em 720p, o que resulta em aproximadamente 0,10 dólar por segundo sob a tarifa padrão. Todo vídeo gerado recebe a marca d'água SynthID, invisível ao espectador, mas detectável por sistemas para fins de rastreamento de origem.

A edição conversacional foi implementada por meio da Interactions API. As alterações são stateful, ou seja, o modelo mantém o estado das edições anteriores. Basta enviar o identificador da interação prévia, chamado previous_interaction_id, para que o sistema aplique a nova instrução preservando tudo aquilo que não foi mencionado, sem necessidade de reenviar o vídeo anterior.

O modelo se apoia em três propriedades destacadas pelo Google: a multimodalidade nativa, que processa texto, imagem, áudio e vídeo em conjunto; a edição conversacional via API; e o conhecimento de mundo herdado da família Gemini. Entre as limitações conhecidas estão a ausência de suporte a instruções de sistema, temperatura, top_p, sequências de parada e prompts negativos, estes últimos devendo ser incluídos diretamente no texto do comando. A edição de voz e o uso de referências em áudio não são suportados, e URLs do YouTube não podem ser utilizadas como fonte. Apenas o inglês foi completamente avaliado; outros idiomas permanecem sem validação formal. Para arquivos gerados acima de 4 MB, é necessário utilizar o parâmetro delivery="uri" e consultar a Files API até que o arquivo esteja com status ACTIVE.

O Gemini Omni 1.1 Flash está disponível por meio da Gemini API no Google AI Studio e na plataforma Gemini Enterprise Agent. O Google já cita quatro clientes運用 em produção: Adobe, com o Firefly, Figma Weave, GMI Cloud e Runway. O modelo também foi integrado ao Google Flow para assinantes dos planos AI Plus, Pro e Ultra, e a extensão de cenas está presente no aplicativo Gemini.

A atualização representa um passo importante na maturidade dos modelos de geração de vídeo, ao introduzir controles finos de câmera e continuidade narrativa que aproximam o uso da ferramenta de fluxos profissionais de produção audiovisual.