Skip to content

Melhores modelos de vídeo com IA e suporte a imagens de referência (2026) ​

Última atualização: setembro de 2026.

Gerar um clipe de 10 segundos agora é fácil. Todos os principais modelos fazem isso. A verdadeira questão é: você consegue gerar 5 ou 10 minutos de vídeo coerente em que um personagem tenha a mesma aparência no primeiro e no oitavo minuto? Em que a cena permaneça coesa ao longo de centenas de quadros?

Esse é o problema difícil. E é onde as coisas estão mudando rapidamente. Este guia aborda todos os modelos que encontramos que geram vídeos longos nativamente ou oferecem os recursos necessários para criar conteúdo de longa duração com personagens consistentes por meio de imagens de referência. Nós os dividimos em três categorias: modelos que geram diretamente vídeos com vários minutos, modelos com forte suporte a imagens de referência que podem ser estendidos por continuação e opções de código aberto que você pode executar por conta própria.

Categoria 1: geração nativa de longa duração (minutos ou mais) ​

Esses modelos geram vídeos medidos em minutos, não em segundos. Eles foram desenvolvidos desde o início para manter a consistência temporal em sequências longas.

LongCat Video ​

A Meituan lançou o LongCat Video no fim de 2025. É um transformer de difusão com 13,6 bilhões de parâmetros e o primeiro modelo capaz de gerar com confiabilidade vídeos coerentes de até 15 minutos.

O modelo aceita texto para vídeo, imagem para vídeo e continuação de vídeo em um pipeline unificado. No modo I2V, a imagem de entrada se torna literalmente o primeiro quadro do vídeo. Ela não é uma referência flexível de personagem que você pode inserir em qualquer cena. O modelo cria a animação a partir desse quadro inicial e usa o recurso "Cross-Chunk Latent Stitching" para continuar consultando a imagem original durante toda a geração, evitando desvios de cor e mantendo a consistência visual em sequências longas. Uma variante atualizada de 2026 adiciona a geração de avatares orientada por áudio, com sincronização labial para vídeos de mais de 5 minutos com pessoas falando para a câmera.

Nos bastidores, o LongCat usa uma abordagem de geração do geral para o refinado, com Block Sparse Attention para processar sequências extremamente longas. O ajuste por RLHF melhora a qualidade dos movimentos. No benchmark VBench 2.0, ele ocupa o terceiro lugar geral, atrás do Google Veo 3 e do Vidu Q1, da Shengshu.

Disponibilidade: código aberto sob a licença MIT. Disponível pela API da fal.ai por US$ 0,04 por segundo gerado (US$ 36 por um vídeo de 15 minutos em 720p). Também disponível pela própria plataforma do LongCat, com preços baseados em créditos.

EspecificaçãoValor
Duração máxima~15 minutos
Resolução720p a 30 fps
Parâmetros13,6 bilhões
Imagens de referênciaSomente primeiro quadro (modo I2V, não como referência de personagem)
LicençaMIT
Custo da API~US$ 0,04/segundo (fal.ai)

Seaweed APT2 ​

O Seaweed APT2, da ByteDance, adota uma abordagem diferente. Em vez de gerar um vídeo completo de uma só vez, ele produz quadros de forma autorregressiva a 24 fps, com apenas 0,16 segundo de latência por quadro em uma única H100. O resultado é um vídeo estável de até 5 minutos, com consistência temporal preservada.

O segredo técnico é o Autoregressive Adversarial Post-Training (AAPT), que converte um modelo de difusão de vídeo bidirecional pré-treinado em um gerador autorregressivo unidirecional. Há uma única avaliação forward da rede por quadro. É isso que possibilita a geração em tempo real.

O que torna esse modelo interessante, além da duração bruta, é a interatividade. Você pode controlar a câmera, animar personagens por detecção de pose e manipular as cenas enquanto o vídeo é renderizado. Pense menos em "gerar um vídeo" e mais em "dirigir um vídeo em tempo real".

Disponibilidade: apenas em fase de pesquisa. Ainda não está disponível publicamente. O modelo-base de 7 bilhões de parâmetros (Seaweed-7B) tem um artigo publicado, mas os pesos do APT2 não foram disponibilizados.

EspecificaçãoValor
Duração máxima~5 minutos
Resolução736x416 (uma GPU), até 720p (8 GPUs)
Parâmetros8 bilhões
Imagens de referênciaVia I2V e controle interativo de pose
LicençaNão disponibilizada
StatusPrévia de pesquisa

Helios ​

O Helios vem da Universidade de Pequim e foi desenvolvido sobre o Wan 2.1. É um modelo de 14 bilhões de parâmetros que gera vídeos com duração de minutos a 19,5 fps em uma única H100. A principal inovação está na forma como ele lida com desvios em vídeos longos. Em vez de usar técnicas convencionais contra desvios, como self-forcing ou amostragem de quadros-chave, o Helios simula os desvios durante o treinamento para que o modelo aprenda a corrigi-los.

Ele oferece suporte nativo a tarefas de texto para vídeo, imagem para vídeo e vídeo para vídeo. O modo I2V aceita imagens de referência para iniciar a geração.

Disponibilidade: totalmente de código aberto sob a licença Apache 2.0. Lançado em março de 2026. Código e pesos no GitHub (PKU-YuanGroup/Helios). Integrado ao Diffusers, SGLang e vLLM-Omni. Demonstração em Gradio no HuggingFace Spaces.

EspecificaçãoValor
Duração máximaNa escala de minutos (sem limite fixo)
Resolução720p
Parâmetros14 bilhões
Imagens de referênciaSim (modo I2V)
LicençaApache 2.0
HardwareUma única H100 para geração em tempo real

SkyReels V2 / V3 ​

O SkyReels V3 aceita de 1 a 4 imagens de referência e gera vídeos de duração ilimitada, com alternância entre vários planos e síntese de avatares orientada por áudio.

A linha SkyReels, da Skywork, busca oferecer vídeos de duração infinita. O V2 usa uma arquitetura AutoRegressive Diffusion-Forcing que gera vídeos sem um limite fixo de duração. O V3, lançado em janeiro de 2026, unifica imagem de referência para vídeo, extensão de vídeo para vídeo e geração de avatares orientada por áudio em um único modelo.

O V3 aceita de 1 a 4 imagens de referência e preserva a identidade do sujeito ao longo do vídeo gerado. O modo de vídeo para vídeo permite a continuação contínua de um único plano e a alternância entre vários planos com transições cinematográficas.

A Skywork anunciou o SkyReels V4 em 25 de fevereiro de 2026, um modelo de fluxo duplo que gera vídeo e áudio juntos em até 1080p/32 fps e aceita texto, imagens, clipes de vídeo, máscaras e áudio como entradas de condicionamento. Uma correção em relação ao nosso artigo de julho: o V4 não teve seu código aberto. Em setembro de 2026, a organização SkyworkAI no GitHub tem repositórios do V1 ao V3 e do Matrix-Game, mas não tem pesos do V4 nem uma API pública. Portanto, o V3 continua sendo o modelo aberto mais avançado da Skywork para geração de vídeo por referência.

Disponibilidade: totalmente de código aberto. Modelos de 1,3 bilhão a 14 bilhões de parâmetros. Disponíveis em 540p e 720p. Código e pesos no GitHub e no HuggingFace.

EspecificaçãoValor
Duração máximaIlimitada (autorregressiva)
Resolução540p, 720p
Parâmetros1,3 bilhão, 5 bilhões, 14 bilhões
Imagens de referência1 a 4 imagens (V3)
LicençaCódigo aberto
HardwareMínimo de uma RTX 4090; recomendável de 4 a 8 A100

Categoria 2: clipes curtos com bons recursos de referência e extensão ​

Esses modelos geram clipes de 8 a 60 segundos, mas oferecem bons recursos de imagens de referência e extensão de vídeo. Para conteúdo de longa duração, você encadeia clipes usando os endpoints de continuação ou extensão do modelo. A consistência dos personagens vem de imagens de referência que persistem entre as gerações.

Esse é o fluxo de trabalho mais prático usado atualmente pela maioria dos criadores para conteúdos com mais de um minuto. A qualidade de cada clipe costuma ser superior à dos modelos nativos de longa duração.

Kling 3.0 Omni (Kuaishou) ​

O Kling 3.0 Omni combina elementos de personagens, referências de estilo e storyboard com vários planos em uma única chamada, com saída nativa em 4K a 60 fps.

O Kling tem o sistema de imagens de referência mais completo entre todos os modelos de vídeo. Ele separa as entradas de referência em três categorias distintas, cada uma com uma finalidade diferente:

Imagens de referência (image_urls): até 4 imagens para orientar o estilo e a aparência. Você as marca no prompt como @Image1, @Image2 etc. Elas influenciam o visual geral, o estilo da cena e o ambiente, sem se tornarem o primeiro quadro.

Elementos (elements): entradas dedicadas a personagens e objetos. Cada elemento recebe uma frontal_image_url (foto frontal nítida), além de reference_image_urls opcionais (ângulos adicionais). Você faz referência a eles como @Element1, @Element2 no prompt. O modelo extrai a identidade do personagem e o insere em qualquer cena que você descrever. Esse é o principal recurso para criar conteúdo no estilo de filmes de aventura: envie a foto de um personagem e depois descreva esse personagem caminhando por uma floresta, lutando contra um dragão ou fazendo qualquer outra coisa que você quiser.

Quadros inicial/final (start_image_url, end_image_url): fixam imagens específicas como o primeiro ou o último quadro. São quadros literais, não referências de estilo.

O total entre as três categorias é de até 7 entradas de referência (reduzido para 4 quando também se usa um vídeo de referência). Um único prompt como "@Element1 e @Element2 estão jantando nesta mesa em @Image1" pode combinar personagens com referências de cena.

Para conteúdo de longa duração, o Kling oferece dois caminhos. O modo com vários planos gera até 6 cenas em uma única chamada, cada uma com seu próprio prompt e sua própria duração (de 3 a 15 segundos cada). Os elementos de personagens persistem automaticamente em todos os planos. A API de extensão continua a partir do ponto em que um vídeo concluído terminou, chegando a cerca de 3 minutos por meio de extensões encadeadas. O modo de edição V2V recebe um vídeo existente (de 3 a 10 segundos) e o transforma usando referências de elementos e um prompt de texto, preservando o movimento da câmera e a disposição dos personagens no material original enquanto reformula os personagens e ambientes com base nas referências. Isso torna o Kling particularmente útil para aprimorar materiais preexistentes, incluindo renderizações 3D de baixa fidelidade.

O Kling 3.0 Omni unifica texto para vídeo, imagem para vídeo, referência para vídeo e edição de vídeo em um único modelo, com geração nativa de áudio e sincronização labial. Em junho de 2026, a Kuaishou adicionou o Kling 3.0 Turbo, uma variante mais rápida e barata com áudio incluído em 720p e 1080p, e atualizou o pipeline de edição do Omni para aceitar e produzir vídeos em 4K. Nenhum Kling 3.5 ou 4.0 foi lançado até setembro de 2026, portanto o 3.0 Omni continua sendo o modelo de vídeo atual.

Disponibilidade: API comercial da Kuaishou, fal.ai e Replicate, com preços por segundo que variam de acordo com a resolução e a variante. Interface web em klingai.com.

EspecificaçãoValor
Duração nativa do clipe3 a 15 segundos
Duração estendida~3 minutos (por meio de extensões encadeadas)
Resolução720p, 1080p (4K na edição do Omni)
Imagens de referênciaAté 4 (referências de estilo @Image)
ElementosAté 4 (referências de personagens @Element, com imagem frontal + outros ângulos)
Total de referênciasAté 7 combinadas (4 com vídeo de referência)
Vários planosSim (até 6 planos no storyboard)
ÁudioÁudio sincronizado nativo + sincronização labial
Edição de vídeoSim (edição de vídeos existentes orientada por texto)
APIKuaishou, fal.ai, Replicate

Imagem para vídeo no Kling com várias imagens de referência ​

Essa é a pergunta que mais recebemos sobre o Kling. Portanto, aqui está a versão resumida de como a referência por várias imagens funciona no modelo atual, com base no próprio guia do VIDEO 3.0 Omni do Kling. O modo padrão de imagem para vídeo recebe uma imagem e a anima como o primeiro quadro. A referência por várias imagens é um modo diferente: você envia várias imagens, marca cada uma delas no prompt e o modelo compõe um novo plano a partir delas. Sem um vídeo de referência na solicitação, você pode anexar até 7 imagens e elementos combinados; com um vídeo de referência, esse limite cai para 4. Um único elemento de personagem pode ser criado a partir de até 4 fotos de ângulos diferentes ou de um clipe de vídeo com duração de 3 a 8 segundos contendo apenas um personagem. Você também pode vincular a ele uma gravação de voz de 5 a 30 segundos para que o personagem mantenha a mesma voz entre os planos. No prompt, use @Image1 para uma referência de estilo ou cena e @Element1 (ou o nome atribuído ao elemento) para um personagem ou objeto com identidade fixa. Assim, um prompt como "@Grace caminha por @Image1 ao anoitecer" insere uma personagem consistente na cena fornecida. A saída pode ter até 15 segundos em 720p ou 1080p, com áudio nativo, e a mesma biblioteca de elementos pode ser usada no storyboard com vários planos do Kling. É assim que você mantém um único personagem ao longo de uma sequência de seis planos. Se você precisa apenas de imagens estáticas consistentes, em vez de vídeo, o Kling IMAGE 3.0 aceita até 10 imagens de referência, conforme seu guia de imagens. Um fluxo de trabalho comum é primeiro fixar o personagem nele e, depois, usar essas imagens estáticas como elementos.

Grok Imagine (xAI) ​

O Grok Imagine separa o modo de referência do modo de primeiro quadro, permitindo marcar até 7 imagens como referências de personagens ou objetos no prompt.
A xAI lançou o modo Reference-to-Video do Grok Imagine no início de 2026, com suporte para 1 a 7 imagens de referência. A documentação distingue explicitamente esse recurso de imagem para vídeo: “Ao contrário do modo de imagem para vídeo, no qual a imagem de origem se torna o quadro inicial, as imagens de referência influenciam o que aparece no vídeo sem fixar o primeiro quadro.”

Você identifica as imagens no prompt como <IMAGE_1>, <IMAGE_2> etc. Um prompt como "a modelo de <IMAGE_1> entra na passarela vestindo a camisa de <IMAGE_2>" combina a referência de uma pessoa com a referência de uma peça de roupa. O modelo é capaz de fazer prova virtual de roupas, inserção de produtos e narrativas com personagens consistentes entre cenas.

Uma restrição: não é possível combinar imagens de referência com imagem para vídeo na mesma solicitação. Você precisa escolher entre o modo de primeiro quadro e o modo de referência.

O Grok Imagine também tem um endpoint de extensão de vídeo que adiciona novas cenas ao final de um vídeo existente. O parâmetro duration controla apenas a nova parte. Você pode encadear extensões para criar conteúdos mais longos.

A xAI lançou o Grok Imagine 1.5 como prévia da API em 3 de junho de 2026 e disponibilizou-o de forma geral como grok-imagine-video-1.5 em 16 de junho, com uma variante Fast sendo lançada gradualmente nos aplicativos para consumidores. É um modelo de imagem para vídeo que anima uma única imagem estática, transformando-a em movimento cinematográfico com movimentos de câmera, atmosfera, física e áudio sincronizado gerado nativamente na mesma etapa de inferência. Ele oferece sequenciamento de múltiplas tomadas para encadear cenas consistentes, gera um clipe de 6 segundos em 720p em cerca de 25 segundos e ocupava o terceiro lugar na arena de imagem para vídeo da Artificial Analysis no lançamento. Em setembro de 2026, a página de modelos da xAI lista o Grok Imagine Video 1.5 por $0,08 por segundo e o Grok Imagine Video original por $0,05 por segundo. O Grok Imagine Image 2.0 mais recente da xAI (listado nas notas de versão) é um modelo de imagem estática, útil para definir um personagem antes de animá-lo, mas não é um novo modelo de vídeo.

Disponibilidade: API da xAI (lançada em janeiro de 2026), fal.ai e Replicate. SDK para Python, JavaScript/AI SDK e API REST. US$ 0,05/s em 720p com áudio. Também disponível para assinantes do X Premium.

EspecificaçãoValor
Duração nativa do clipe1 a 15 segundos
Duração estendidaExtensões podem ser encadeadas pela API
Resolução480p, 720p
Imagens de referência1 a 7 (referências reais, não primeiro quadro)
Tags do prompt<IMAGE_1>, <IMAGE_2> etc.
ÁudioSim (720p)
Edição de vídeoSim (orientada por texto)
APIAPI da xAI, fal.ai, Replicate
Custo da API$0,05/segundo (Video), $0,08/segundo (Video 1.5)

Seedance 2.0 (ByteDance) ​

O Seedance 2.0 aceita até 12 entradas multimodais simultaneamente e gera vídeo com sincronização nativa de áudio e sincronia labial no nível de fonemas em mais de 8 idiomas.

O Seedance 2.0 da ByteDance aceita mais entradas de referência do que qualquer outro modelo: até 12 arquivos simultaneamente, incluindo até 9 imagens, 3 vídeos e 3 arquivos de áudio. O modelo oferece geração nativa de áudio e vídeo com sincronia labial no nível de fonemas em mais de 8 idiomas.

Cada imagem pode ter até 30 MB. Os vídeos de referência devem ter entre 2 e 15 segundos. O modelo usa as referências para definir a aparência dos personagens, o estilo das cenas e orientar o movimento.

O avanço seguinte já foi lançado. A ByteDance anunciou o Seedance 2.5 em sua conferência FORCE da Volcano Engine, em 23 de junho de 2026, e o lançou em 31 de julho de 2026. Segundo o anúncio da equipe Seed, ele gera um único clipe nativo de até 30 segundos com extensões em várias rodadas, aceita até 30 imagens, 10 clipes de vídeo e 10 clipes de áudio como referências em uma única execução (50 arquivos, em vez de 12) e adiciona edição no nível de marcações de tempo, permitindo alterar um momento específico do clipe sem regenerá-lo. Ele chegou primeiro ao Jimeng e ao Doubao, depois à API empresarial BytePlus ModelArk, e foi rapidamente adotado por terceiros: a API da Runway adicionou o Seedance 2.5 em 7 de agosto de 2026, com durações de 4 a 30 segundos e até 30 imagens de referência, segundo o registro de alterações da Runway. Para o fluxo de trabalho narrativo deste guia, uma tomada única de 30 segundos com 50 referências elimina grande parte da junção de clipes descrita abaixo.

Disponibilidade: API oficial da ByteDance (via Volcengine, lançada em fevereiro de 2026) e provedores terceirizados de API. Saída de 480p a 720p pela API e resolução cinematográfica de até 2K pela plataforma.

EspecificaçãoValor
Duração nativa do clipe4 a 15 segundos
ResoluçãoAté 2K (cinematográfica)
Imagens de referênciaAté 9 imagens + 3 vídeos + 3 áudios (12 no total)
Duração do clipe do Seedance 2.5Até 30 segundos nativos, com extensões
Referências do Seedance 2.5Até 30 imagens + 10 vídeos + 10 áudios (50 no total)
ÁudioNativo com sincronia labial (mais de 8 idiomas)
APIByteDance/Volcengine, BytePlus ModelArk (2.5), API da Runway (2.5), provedores terceirizados

Runway Gen-4.5 ​

O Runway Gen-4.5 foi lançado no topo da classificação de texto para vídeo da Artificial Analysis, com 1.247 ELO, à frente do Veo 3 e do Sora 2 Pro na época. Em setembro de 2026, a classificação da arena havia mudado (Gemini Omni Flash e Wan 3.0 da Alibaba dividem o primeiro lugar, enquanto o Gen-4.5 está fora dos dez primeiros), mas o Gen-4.5 continua sendo um modelo sólido para qualidade cinematográfica e ações controláveis, e a Runway ainda não lançou um Gen-5. O modelo gera clipes de 2 a 10 segundos por texto para vídeo e permite criar vídeos longos, com personagens consistentes, de até um minuto por meio do sequenciamento de múltiplas tomadas.

O recurso de imagem para vídeo foi adicionado no início de 2026 e aceita imagens de referência em todas as proporções de tela. As outras iniciativas da Runway em 2026 se concentraram em edição e roteamento, não em um novo modelo-base: o Aleph 2.0 (2 de junho de 2026) edita um vídeo existente de 2 a 30 segundos a partir de um prompt de texto e até 5 imagens de quadros-chave fixadas em marcações de tempo; o Gen-3 Alpha Turbo e o Gen-4 Aleph original foram removidos da API em 30 de julho de 2026; e a API agora também oferece modelos de terceiros, incluindo Gemini Omni Flash e Seedance 2.5, tudo segundo o registro de alterações da Runway. O modelo integra campos de radiância neural e Gaussian splatting à arquitetura de difusão, proporcionando compreensão geométrica 3D em vez de apenas previsão no nível dos pixels. Isso resulta em melhor permanência dos objetos e movimentos fisicamente plausíveis.

Disponibilidade: API comercial e interface web. SDKs para Node e Python. Também disponível no Replicate.

EspecificaçãoValor
Duração nativa do clipe2 a 10 segundos
Modo de longa duraçãoAté aproximadamente 1 minuto
ResoluçãoAté 1080p
Imagens de referência0 a 1 por geração
ÁudioGeração nativa de áudio
Múltiplas tomadasSim
APISim (Runway, Replicate)

Google Veo 3.1 ​

O Veo 3.1 do Google gera nativamente clipes de 4, 6 ou 8 segundos. O recurso “Extend Video” (atualmente em prévia) encadeia clipes para alcançar aproximadamente 1 a 2,5 minutos, embora a coerência possa se perder em sequências mais longas.

O recurso “Ingredients to Video” aceita até 3 imagens de referência como entrada. Você pode fornecer personagens para animar, planos de fundo e texturas de materiais. Ao usar imagens de referência, o modelo segue mais de perto suas referências visuais e faz menos alterações aleatórias. Uma limitação: o modo de imagens de referência só funciona com a opção de duração de 8 segundos.

Em janeiro de 2026, o Veo 3.1 adicionou vídeo vertical (9:16) para geração baseada em referências e ampliação para 4K no Vertex AI. Em seguida, o Google lançou o Veo 3.1 Lite em 31 de março de 2026 como seu modelo de vídeo mais barato, descontinuou o Veo 2.0 e o 3.0 em 30 de junho de 2026 e, até setembro de 2026, não anunciou um Veo 4, segundo o registro de alterações da API Gemini. Os trabalhos mais recentes da empresa com vídeo estão sendo direcionados ao Gemini Omni Flash, descrito abaixo.

Disponibilidade: API Google Vertex AI, API Gemini e Google Flow. Requer uma conta do Google Cloud.

EspecificaçãoValor
Duração nativa do clipe4, 6 ou 8 segundos
Duração estendidaAproximadamente 1 a 2,5 minutos
ResoluçãoAté 4K (com ampliação)
Imagens de referênciaAté 3 (“Ingredients to Video”)
ÁudioDiálogos e música sincronizados
APIVertex AI, API Gemini

Google Gemini Omni Flash ​

O Google anunciou a família Gemini Omni no I/O em maio de 2026 e lançou o Gemini Omni Flash como seu primeiro modelo. Ele rapidamente alcançou o primeiro lugar na arena da Artificial Analysis, à frente do Veo 3.1. A proposta é o vídeo conversacional: você gera um clipe de 10 segundos a partir de texto, imagens ou vídeo e depois o edita com instruções de acompanhamento que se complementam. Altere a iluminação, troque uma roupa ou ajuste a câmera, tudo sem regenerar o vídeo do zero.

Quanto ao suporte a referências, o Omni Flash aceita imagens e clipes curtos de vídeo como referências de estilo, movimento e efeitos, com referências de áudio planejadas. A consistência dos personagens é mantida durante as edições conversacionais, embora a própria documentação do Google observe que ela pode falhar durante mudanças de cena e panorâmicas de câmera. Portanto, revise resultados com forte presença de personagens antes de publicá-los.

Disponibilidade: A API (gemini-omni-flash-preview) entrou em prévia pública em 30 de junho de 2026 pelo Google AI Studio e pela API Gemini, por aproximadamente $0,10 por segundo de saída, e o gemini-omni-1.1-flash chegou à disponibilidade geral em 27 de agosto de 2026 com extensão de vídeo, interpolação e controles de resolução, segundo o registro de alterações da API Gemini. Todos os clipes carregam uma marca d'água SynthID. O acesso para consumidores ocorre pelo aplicativo Gemini, pelo Google Flow e pelo YouTube Shorts, e a API da Runway também oferece acesso a ele.

EspecificaçãoValor
Duração nativa do clipe10 segundos (durações maiores estão planejadas)
Resolução720p
Entradas de referênciaImagens + clipes curtos de vídeo (áudio planejado)
EdiçãoConversacional e iterativa
ÁudioNativo
APIAPI Gemini (disponibilidade geral como gemini-omni-1.1-flash), aproximadamente $0,10/s

OpenAI Sora 2 / Sora 2 Pro ​

Sendo descontinuado (2026): a OpenAI está encerrando o Sora. O aplicativo Sora para consumidores foi fechado em 26 de abril de 2026, e a API do Sora 2 será desativada em 24 de setembro de 2026, sem sucessor anunciado, segundo a página de descontinuações da OpenAI. Os recursos abaixo continuam relevantes, mas não crie um novo pipeline com o Sora. Em vez disso, use Kling, Grok Imagine ou um modelo aberto.

O Sora 2 Pro gera clipes de até 20 segundos. A Characters API usa uma abordagem diferente da adotada pelo Kling ou pelo Grok: em vez de enviar imagens estáticas, você cria um character_id apontando a API para um clipe de vídeo (com um intervalo de marcação de tempo de 1 a 3 segundos). O Sora analisa os quadros do vídeo para extrair estrutura facial, proporções corporais, estilo das roupas e outras características de identificação. Esse character_id persiste indefinidamente e pode ser reutilizado em um número ilimitado de gerações futuras.

Você pode usar como referência até 2 personagens enviados por geração. Desde março de 2026, as referências de personagens também funcionam para objetos e animais, não apenas para pessoas. A extensão de vídeo usa todo o clipe inicial como contexto para a continuação.

O sistema de personagens requer uma entrada de vídeo, e não imagens estáticas, para criar personagens. Se você tiver apenas fotos, precisará primeiro gerar um vídeo curto e depois extrair o personagem dele.

Disponibilidade: API da OpenAI com suporte à Batch API para fluxos de trabalho de produção.

EspecificaçãoValor
Duração nativa do clipeAté 20 segundos
ResoluçãoAté 1920x1080
Referências de personagensAté 2 por geração (character_id persistente)
Entrada do personagemClipe de vídeo (intervalo de marcação de tempo de 1 a 3 s), não imagens estáticas
ÁudioSincronizado
ExtensãoSim (clipe completo como contexto)
APIAPI da OpenAI + Batch API

MiniMax Hailuo 02 ​

O Hailuo 02 ficou em segundo lugar mundial no benchmark da Artificial Analysis em seu lançamento, superando o Veo 3. Ele gera clipes de 10 segundos em 1080p nativo, com uma das melhores simulações de física do setor. O modelo processa movimentos extremos, como ginástica e acrobacias, sem deformar os elementos da cena.

Ele oferece geração de imagem para vídeo com grande consistência de personagens por meio de reconhecimento facial e rastreamento corporal. A arquitetura Noise-aware Compute Redistribution aloca dinamicamente o processamento de acordo com a complexidade da cena.

Desde então, a MiniMax avançou além do Hailuo 02 com a família Hailuo 2.3 (Standard, Pro, Fast e Fast Pro), que melhora ações físicas, estilização e microexpressões dos personagens. Ela produz vídeos em 1080p com 6 segundos ou 768p com 10 segundos e está disponível pela plataforma MiniMax e pela fal.ai.

Disponibilidade: API comercial. Disponível pela plataforma MiniMax, fal.ai e Replicate. US$ 0,28 por vídeo.

EspecificaçãoValor
Duração nativa do clipeAté 10 segundos
Resolução1080p nativo
Imagens de referênciaSim (modo I2V)
ÁudioNão nativo
FísicaSimulação entre as melhores da categoria
APIMiniMax, fal.ai, Replicate

MiniMax H3 (Hailuo 3.0) ​

A MiniMax substituiu a linha Hailuo 2.x pelo MiniMax H3 em 31 de julho de 2026, mudando a posição do Hailuo neste guia. Enquanto o Hailuo 02 era um modelo de primeiro quadro, o H3 é multimodal: um único transformer processa texto, imagens, vídeo e áudio em conjunto e produz um clipe de 4 a 15 segundos em até 2K com áudio estéreo nativo, segundo o anúncio da MiniMax. Seu modo de referência (Ref2VA) aceita até 9 imagens de referência, 3 clipes de vídeo de referência e 3 clipes de áudio, com limite de 12 arquivos, colocando-o na mesma categoria de referências reais do Kling e do Seedance 2.0. Já o modo de primeiro e último quadro (FL2VA) atende ao fluxo de trabalho clássico com quadros-chave. Na arena de texto para vídeo da Artificial Analysis, as versões H3 e H3 Max aparecem logo atrás do Omni Flash e do Wan 3.0 em setembro de 2026. A maior novidade para quem hospeda o modelo por conta própria é que a MiniMax lançou os pesos-base de 33B em agosto de 2026 no Hugging Face, com checkpoints FL2VA e Ref2VA. A licença é a MiniMax H3 Community License, e o card do modelo solicita que usuários dos EUA, da UE, do Reino Unido e da Coreia do Sul enviem um formulário de inscrição antes do uso. Portanto, ele é aberto com uma ressalva regional, em vez de ser aberto nos moldes da Apache.

Disponibilidade: API e plataforma da MiniMax, fal.ai e outros provedores, além de pesos para download.

EspecificaçãoValor
Duração nativa do clipe4 a 15 segundos
ResoluçãoAté 2K (lado menor em 768p por padrão)
Imagens de referênciaAté 9 imagens + 3 vídeos + 3 áudios (12 no total, Ref2VA)
Quadros-chavePrimeiro e/ou último quadro (FL2VA)
ÁudioEstéreo nativo, 32 kHz
Pesos abertosSim, 33B, MiniMax H3 Community License (inscrição para EUA/UE/Reino Unido/Coreia do Sul)
APIMiniMax, fal.ai

Luma Ray3.2 ​

O Ray2 da Luma foi substituído pela família Ray3. O Ray3 (setembro de 2025) adicionou o Character Reference para fixação de identidade e um modo Modify de vídeo para vídeo, enquanto o Ray3.2 (9 de junho de 2026) adicionou controle por quadro com até 16 quadros-chave por clipe, um recurso de reenquadramento e clipes de até 20 segundos, além da primeira API pública da linha Ray3. A saída é nativamente em 1080p, com 4K disponível por meio do upscaling Hi-Fi. O modo de imagem para vídeo aceita imagens de referência como quadros-chave iniciais ou finais.

Disponibilidade: API e interface web da Luma.

EspecificaçãoValor
Duração nativa do clipeAté 20 segundos (Ray3.2)
Tipo de referênciaQuadros-chave iniciais/finais + Character Reference (identidade)
Resolução1080p nativo, 4K por upscaling
Imagens de referênciaSim (quadros-chave + referência de personagem)
APIAPI da Luma

Pika 2.5 ​

O Pika adota uma abordagem baseada em quadros-chave com o Pikaframes. Você envia de 2 a 5 quadros-chave (imagens de referência em momentos importantes), e o modelo gera transições suaves entre eles. A duração total chega a 20-25 segundos.

O Pikascenes aceita até 10 imagens de referência e as combina em um único vídeo. O modelo usa reconhecimento de imagens para identificar automaticamente a função de cada referência (personagem, cenário ou objeto de cena).

Disponibilidade: Plataforma web e API do Pika. Planos de assinatura do gratuito ao Pro.

EspecificaçãoValor
Duração nativa do clipe5 a 10 segundos
Duração no Pikaframes20 a 25 segundos
ResoluçãoAté 1080p
Imagens de referênciaAté 10 (Pikascenes), 2 a 5 quadros-chave (Pikaframes)
APISim

Vidu Q3 (ShengShu) ​

O Vidu merece uma seção que não tinha nas versões anteriores deste guia, pois sua linha Q3 se tornou um dos sistemas de referência de sujeitos mais robustos disponíveis. A ShengShu lançou o Vidu Q3 no início de 2026 com áudio nativo e clipes de até 16 segundos e, em 13 de abril de 2026, adicionou o Q3 Reference-to-Video, de acordo com seu anúncio de lançamento. O modo de referência combina sujeitos, ambientes, figurinos, objetos de cena e estilos visuais em uma única solicitação. Segundo a documentação da API do Vidu, o endpoint reference2video aceita até 7 imagens de referência, que você marca no prompt como @1, @2 e assim por diante ("@1 e @2 estão cozinhando juntos"). As durações variam de 3 a 16 segundos no viduq3, a resolução chega a 1080p e a geração de áudio é habilitada por uma flag. Ele também faz alternância inteligente de câmera dentro de um único clipe, algo incomum e útil para cenas com diálogos. A ShengShu afirma que o Q3 liderou o primeiro ranking de Reference-to-Video da SuperCLUE, e o Vidu já era o modelo que desafiava o Veo no VBench 2.0 quando escrevemos este guia pela primeira vez.

Disponibilidade: Aplicativo web e API do Vidu (viduq3, viduq3-turbo), além do Alibaba Cloud Model Studio e provedores terceiros.

EspecificaçãoValor
Duração nativa do clipe3 a 16 segundos
ResoluçãoAté 1080p
Imagens de referênciaAté 7 (tags @1, @2)
Tipos de referênciaSujeitos, ambientes, objetos de cena, figurinos, estilos
ÁudioNativo (efeitos sonoros, diálogos, música)
APIAPI do Vidu, Alibaba Cloud Model Studio

Nível 3: modelos de código aberto para fluxos de trabalho com hospedagem própria ​

Esses modelos geram clipes mais curtos, mas são totalmente abertos. Você pode executá-los no seu próprio hardware, fazer ajustes finos e criar pipelines personalizados de extensão sem depender de APIs.

Wan 2.1 (Alibaba) ​

O Wan 2.1 é a base sobre a qual vários outros modelos foram construídos (incluindo o Helios). A arquitetura Wan-VAE codifica e decodifica vídeos em 1080p de qualquer duração, preservando as informações temporais. O modelo está disponível em variantes I2V de 480p e 720p, além de um modelo First-Last-Frame-to-Video que gera vídeo entre duas imagens de referência.

O Wan-Edit permite transferir estilo e conteúdo usando imagens de referência, preservando estruturas específicas ou poses de personagens. O Wan 2.2 (julho de 2025) é a versão aberta mais recente, um modelo Mixture-of-Experts com uma variante de 5B que roda em uma única RTX 4090, ainda sob a licença Apache 2.0. Uma ressalva importante para quem hospeda o modelo por conta própria: o Wan se tornou fechado a partir da versão 2.5. Os Wan 2.5, 2.6, 2.7 e agora o Wan 3.0 adicionaram áudio sincronizado e resoluções maiores, mas estão disponíveis apenas via API, sem pesos públicos. Assim, o 2.2 continua sendo o limite das versões abertas. O Wan 3.0 chegou em agosto de 2026 ao Alibaba Cloud Model Studio e, segundo sua página do modelo, gera até 30 segundos de uma só vez, em 480p, 720p ou 1080p, usando referências de texto, imagem, vídeo e áudio. Em setembro de 2026, ele divide a liderança da arena de texto para vídeo da Artificial Analysis com o Gemini Omni Flash. É um produto hospedado, não um download. Ignore as páginas feitas para SEO que afirmam ser possível baixar os pesos do Wan 2.7 ou 3.0. A organização oficial no GitHub e a conta no Hugging Face vão somente até a versão 2.2 (os uploads mais recentes são atualizações do Wan2.2-Animate).

EspecificaçãoValor
Parâmetros1.3B, 5B, 14B (2.1); MoE de 5B + 14B (2.2)
Modos I2VI2V-480P, I2V-720P, FLF2V-720P
Limite das versões abertasWan 2.2 (da 2.5 à 3.0, apenas via API)
LicençaApache 2.0
Hardware8 GB ou mais de VRAM (variantes menores)
PlataformasDiffusers, ComfyUI

HunyuanVideo (Tencent) ​

O modelo de 13B parâmetros da Tencent liderou a geração de vídeo de código aberto durante a maior parte de 2025. O HunyuanVideo-I2V usa uma técnica de substituição de tokens com um MLLM pré-treinado para incorporar informações da imagem de referência. O HunyuanVideo-1.5, lançado em novembro de 2025, melhorou a eficiência. O HunyuanCustom permite a geração personalizada de vídeos orientada por entradas multimodais.

EspecificaçãoValor
Parâmetros13B
I2VSim (técnica de substituição de tokens)
LicençaCódigo aberto
Hardware60 GB ou mais de VRAM (720p)
VariantesBase, I2V, 1.5, Avatar, Custom

LTX-2 (Lightricks) ​

A Lightricks lançou o LTX-2 como código aberto em janeiro de 2026, com pesos completos, código de inferência e código de treinamento. É um modelo baseado em DiT que gera vídeo e áudio sincronizado juntos em uma única passagem, com 4K nativo, até 50 fps e clipes de até 20 segundos. O condicionamento por imagem para vídeo e por múltiplos quadros-chave é integrado, permitindo fixar imagens de referência em pontos ao longo do clipe, como no Pikaframes.

A ressalva é a licença — ou talvez não seja, dependendo do tamanho da sua empresa. O LTX-2 é gratuito para pesquisa e uso comercial por empresas com receita anual inferior a $10 milhões. Acima disso, é necessária uma licença comercial. Portanto, trata-se de pesos abertos, e não de código aberto no sentido estrito. O LTX-2.3 foi uma atualização de 22B parâmetros com áudio melhor e maior fidelidade aos prompts. O LTX-2.5, checkpoint atual em setembro de 2026, mantém o tamanho de 22B e adiciona geração nativa de múltiplos planos, preservando o mesmo personagem e visual em várias tomadas conectadas, um decodificador de vídeo por difusão no lugar da reconstrução VAE convencional e um codificador de texto Gemma 4 12B para prompts longos. Tudo continua sob a LTX-2.x Community License, com o mesmo limite de receita de $10 milhões. Os pesos estão no Hugging Face, junto com variantes destiladas, adaptadores LoRA e integrações com ComfyUI e Diffusers. APIs hospedadas estão disponíveis na plataforma LTX, no fal.ai e no Replicate.

EspecificaçãoValor
Parâmetros22B (LTX-2.3 e LTX-2.5)
Duração máxima do clipe~20 segundos
Resolução4K nativo em até 50 fps
ÁudioSincronizado nativamente
I2VSim (condicionamento por imagem + múltiplos quadros-chave)
LicençaLTX-2 Community License (gratuita abaixo de US$ 10 milhões de receita anual recorrente)
HardwareVariantes destiladas e FP8 para GPUs de consumo

CogVideoX (Tsinghua/Zhipu AI) ​

O CogVideoX usa um VAE causal 3D que reduz o comprimento das sequências e evita cintilação. O transformer com LayerNorm adaptativa melhora o alinhamento entre texto e vídeo. Está disponível em variantes de 2B (Apache 2.0) e 5B (licença para pesquisa), com integração nativa ao Diffusers.

Os clipes têm de 6 a 10 segundos em 720x480. São curtos, mas a relação entre qualidade e capacidade computacional é boa, e o modelo roda em uma GPU com 12 GB.

EspecificaçãoValor
Parâmetros2B, 5B
I2VSim (CogVideoXImageToVideoPipeline)
Resolução720x480 a 8 fps
LicençaApache 2.0 (2B), pesquisa (5B)
Hardware12 GB de VRAM

Primeiro quadro vs. referência verdadeira: a principal diferença ​

Nem todo suporte a "imagem de referência" funciona da mesma forma. Entender a diferença é essencial para escolher o modelo certo.

Modelos de primeiro quadro (LongCat, Helios, Hailuo, Luma Ray2, HunyuanVideo) tratam sua imagem como o quadro inicial literal. O modelo cria a animação a partir daquele visual exato. Você não pode enviar o retrato de um personagem e descrevê-lo em outra cena. A imagem é a cena.

Modelos de referência verdadeira (Kling, Grok Imagine, Seedance, Vidu Q3, MiniMax H3, SkyReels V3) extraem a identidade da imagem e colocam o personagem ou objeto em qualquer cena que você descrever. Envie a foto de uma pessoa e use o prompt "essa pessoa caminha por uma floresta ao pôr do sol". O personagem aparece em um ambiente completamente novo, mantendo sua identidade. É disso que você precisa para conteúdo narrativo com várias cenas, como um filme de aventura.

Modelos com ID de personagem (Sora 2 Pro) extraem a identidade de clipes de vídeo em vez de imagens estáticas. Você cria uma ID persistente para o personagem uma vez e a reutiliza em um número ilimitado de gerações futuras.

Modelos de estilo/ingredientes (Veo 3.1) usam imagens de referência para influenciar o estilo visual, as texturas e a aparência geral, em vez de extrair identidades específicas de personagens. São bons para manter a consistência visual em todo o projeto, mas menos precisos para controlar personagens individuais.

O fluxo de trabalho real para vídeos de 10 minutos ​

Esta é a avaliação sincera da situação em meados de 2026. Nenhum modelo consegue gerar de forma confiável 10 minutos de vídeo consistente e de alta qualidade em uma única execução. O LongCat Video é o que mais se aproxima, alegando alcançar 15 minutos, mas a qualidade e a coerência variam bastante nessas durações. O Helios e o SkyReels V2 geram vídeos "na escala de minutos" e de "duração infinita", respectivamente, mas os resultados exigem prompts cuidadosos e, muitas vezes, várias tentativas.

O fluxo de trabalho que realmente funciona para a maioria dos criadores que produzem vídeos de 5 a 15 minutos combina várias abordagens:

Para conteúdo com apresentador ou avatar: O modo orientado por áudio de 2026 do LongCat Video ou a geração de avatares do SkyReels V3 consegue produzir mais de 5 minutos com um personagem falando de forma consistente. É o que mais se aproxima de "apertar um botão e obter um vídeo longo".

Para conteúdo narrativo com várias cenas (no estilo de um filme de aventura): Use o Kling 3.0, o Grok Imagine ou o Seedance 2.0 com imagens de referência verdadeira de personagens. Gere planos individuais de 10 a 15 segundos. Use as mesmas referências @Element ou <IMAGE> em todas as gerações para preservar a identidade do personagem. Encadeie os planos usando o modo de múltiplos planos (o Kling aceita 6 planos por chamada) ou a API de extensão. O Kling é a opção mais testada em produção para esse fluxo de trabalho. A separação explícita do Grok Imagine entre "modo de referência" e "modo de primeiro quadro" faz dele uma alternativa robusta. O Seedance 2.5 agora aceita o maior número de entradas de referência (50 arquivos) e gera tomadas de 30 segundos, reduzindo aproximadamente pela metade a quantidade de emendas. O Vidu Q3 (7 referências com tags @) e o MiniMax H3 (12 arquivos) também são opções mais recentes e promissoras.

Para manter a consistência de personagens em muitos clipes: O sistema persistente de character_id do Sora 2 Pro é a abordagem mais simples para projetos muito longos. Extraia o personagem uma vez a partir de um vídeo curto e, depois, gere dezenas de clipes referenciando essa ID. A identidade do personagem não se degrada com o tempo porque é armazenada como um embedding persistente, em vez de ser reinterpretada a partir de uma imagem a cada geração.

Para conteúdo com transferência de estilo: O Lucy Restyle no fal.ai processa vídeos existentes de até 30 minutos, aplicando transformações de estilo por IA e preservando o movimento. Se você já tem o material de origem, isso contorna completamente o problema de duração da geração. US$ 0,01 por segundo do vídeo de origem.

Para pipelines de código aberto: Use o Wan 2.2 ou o Helios como base em um loop de continuação de vídeo, ou o checkpoint Ref2VA do MiniMax H3 caso a licença comunitária seja adequada à sua região, pois ele é o primeiro modelo aberto com um modo de referência de 9 imagens. Gere um clipe, use o último quadro como quadro inicial do próximo clipe e repita. Fluxos de trabalho no ComfyUI automatizam esse processo. A consistência piora ao longo de muitas iterações, mas é uma opção gratuita e controlável.

O principal desafio permanece: mesmo com suporte a imagens de referência verdadeira, o desvio de identidade do personagem se acumula ao longo de dezenas de clipes. Traços faciais, cabelo, roupas e tom de pele mudam gradualmente. As soluções alternativas — fotos de referência de alta qualidade, prompts consistentes e geração de planos em lotes — são necessárias. Porém, modelos como o Kling e o Grok Imagine, que separam a identidade do personagem da composição da cena, tornam esse processo muito mais fácil do que nos modelos limitados ao primeiro quadro.

A abordagem com estrutura 3D: renderize em baixa, transforme em alta ​

Há um fluxo de trabalho ganhando popularidade que contorna quase todos os problemas da geração de vídeos longos. Em vez de pedir a um modelo de IA que gere 10 minutos de vídeo do zero, você renderiza uma cena 3D de baixa fidelidade com o trabalho de câmera, o posicionamento dos personagens e o timing corretos e, depois, a processa com um modelo de vídeo para vídeo usando imagens de referência e um prompt de aprimoramento. O motor 3D cuida da estrutura. A IA cuida da estética. Isso funciona porque a transformação V2V é um problema mais restrito do que a geração completa. O modelo não precisa inventar o movimento da câmera, o posicionamento dos personagens ou a composição da cena. Ele só precisa fazer com que a filmagem existente pareça fotorrealista, seguindo suas referências visuais. Isso é muito mais viável e pode ser dimensionado para qualquer duração que seu motor 3D consiga renderizar.

Por que isso funciona ​

Seu motor 3D oferece tudo aquilo com que os modelos de vídeo por IA ainda têm dificuldade: controle preciso da câmera, posicionamento exato dos personagens no quadro, interações físicas corretas e temporização consistente ao longo de vários minutos de filmagem. Efeito dolly zoom, planos de acompanhamento, personagens entrando e saindo do quadro no momento certo — tudo trivial em um motor 3D e pouco confiável na geração orientada por prompts de texto. A única tarefa do modelo V2V é transformar materiais, iluminação e texturas em um resultado fotorrealista, preservando a geometria e o movimento que você já definiu.

A consistência dos personagens também fica mais fácil. Em vez de lutar contra a deriva de identidade em 50 gerações de IA separadas, você mostra ao modelo o mesmo personagem 3D em todos os quadros. As imagens de referência dizem ao modelo como esse personagem deve aparecer no resultado final. Esse é um problema mais simples do que gerar um personagem consistente do zero a cada vez.

E a duração deixa de ser uma limitação. O Lucy Restyle processa 30 minutos em uma única chamada. O Wan 2.1 no ComfyUI pode processar qualquer duração em segmentos. Você nem precisa enfrentar o problema de “como gerar 10 minutos”, porque a filmagem já existe.

RealMaster (Meta / Universidade de Tel Aviv) ​

O RealMaster é um sistema de pesquisa criado especificamente para esse fluxo de trabalho. Publicado em março de 2026 pela Meta Reality Labs e pela Universidade de Tel Aviv, ele transforma vídeos 3D renderizados em vídeos fotorrealistas, mantendo alinhamento geométrico completo com a fonte.

O método extrai mapas de bordas da renderização 3D para preservar a estrutura e o movimento e, em seguida, aplica um modelo de difusão de vídeo — baseado na arquitetura VACE/Wan — para transformar todo o restante em um resultado fotorrealista. Um adaptador IC-LoRA leve condensa o pipeline em uma única etapa de inferência, que não precisa de quadros de ancoragem e processa objetos que aparecem no meio da sequência.

Testado em sequências dos simuladores GTA-V e CARLA, o RealMaster supera significativamente as referências de edição de vídeo de uso geral. Ele também pode adicionar efeitos climáticos por meio do prompt de texto (“Faça chover”, “Faça nevar”) sobre a transformação de realismo. O modelo se generaliza entre simuladores sem novo treinamento. Pesos treinados com dados do GTA-V funcionam em resultados do CARLA sem nenhum ajuste adicional.

Disponibilidade: Apenas para pesquisa. Ainda não há pesos públicos nem API.

EspecificaçãoValor
EntradaVídeo 3D renderizado (qualquer motor)
SaídaVídeo fotorrealista que preserva geometria e movimento
ArquiteturaIC-LoRA sobre backbone de difusão de vídeo VACE/Wan
CondicionamentoMapas de bordas da renderização de origem
Testado emSimuladores GTA-V e CARLA
LicençaNão lançado (apenas artigo de pesquisa)

Ferramentas V2V de produção disponíveis hoje ​

O Kling 3.0 V2V com referências de elementos é a opção de produção mais completa. Os endpoints Edit Video e Reference V2V no fal.ai aceitam clipes de vídeo de origem de 3 a 10 segundos junto com referências de elementos (@Element1, @Element2, com fotos frontais e de vários ângulos) e um prompt de aprimoramento. O modelo analisa as trajetórias de movimento e os padrões de câmera da fonte e, em seguida, regenera a filmagem com as aparências de personagens e o estilo visual especificados por você, preservando a encenação e o trabalho de câmera originais. Suporta até 7 entradas de referência. Saída em 1080p. Processe sua cena em segmentos de 10 a 15 segundos, usando as mesmas referências de elementos em todos eles para manter a consistência dos personagens.

O Lucy Restyle 2 processa até 30 minutos de vídeo de origem em uma única chamada de API, por US$ 0,01 por segundo de entrada. Ele aceita um prompt de texto e uma imagem de referência opcional para orientar o estilo. Não oferece referências de elementos por personagem como o Kling, mas, para transferir um estilo cinematográfico geral a uma renderização 3D completa, é o caminho mais simples e barato. Envie sua renderização completa e um prompt que descreva o visual desejado. A saída é em 720p, com consistência temporal ao longo de milhares de quadros.

O Wan 2.1 VACE no ComfyUI é a opção de código aberto. O modelo VACE 14B realiza V2V orientado por referência: recebe um vídeo de origem e uma imagem de referência de estilo e gera uma versão reestilizada que preserva a estrutura e o movimento. O condicionamento por mapas de bordas melhora a fidelidade estrutural. Você pode criar um loop de processamento que lide com qualquer duração em segmentos, usando referências de estilo consistentes. É gratuito e roda localmente no seu próprio hardware.

O Grok Imagine V2V aceita um vídeo de origem e de 1 a 7 imagens de referência no modo de referência. Custa US$ 0,05 por segundo em 720p. A separação explícita entre o modo de referência e o modo de primeiro quadro permite que suas referências orientem a aparência dos personagens sem substituir a estrutura do vídeo de origem.

O que sua renderização 3D precisa ter ​

O nível mínimo de qualidade da renderização importa. Uma malha de arame simples não dará ao modelo V2V informações suficientes para trabalhar. Mas você também não precisa de materiais ou iluminação com qualidade de produção.

Proporções e geometria corretas. Os modelos de personagens precisam ter proporções corporais e estrutura facial razoavelmente corretas para que as imagens de referência sejam mapeadas adequadamente. Uma geometria humanoide básica com proporções corretas é suficiente. Um boneco de palito não produzirá um personagem reconhecível.

Direção básica da iluminação. Uma única luz direcional que estabeleça a iluminação geral da cena ajuda o modelo a entender a atmosfera pretendida. A IA aprimorará e adicionará detalhes, mas precisa saber se a cena ocorre sob luz intensa do dia ou em um interior escuro.

Movimento de câmera suave. Movimentos de câmera estáveis e deliberados são bem transferidos. Movimentos erráticos ou extremamente rápidos podem confundir os modelos V2V. Faça sua câmera virtual se comportar como uma câmera real.

Sombreamento plano em vez de malha de arame. Geometria simples com sombreamento plano ou poucos polígonos produz resultados melhores do que malhas de arame ou modelos sem textura. Até mesmo cores sólidas básicas nas superfícies ajudam o modelo a entender os limites dos materiais.

Custo e escala ​

Processamento de uma cena de 10 minutos com diferentes ferramentas:

FerramentaDuração máxima da entradaCusto por 10 minResoluçãoImagens de referência
Kling O3 V2VClipes de 10s~US$ 50-671080pAté 7 (elementos + estilo)
Lucy Restyle 230 minutosUS$ 6720p1 (apenas estilo)
Grok Imagine V2VClipes de 10s~US$ 30720p1-7
Wan 2.1 VACEQualquer duração (segmentada)Gratuito (GPU local)720p1 por segmento

Esses valores são nossas estimativas com base nos preços de tabela dos fornecedores quando fizemos a comparação pela primeira vez, em meados de 2026. Como os fornecedores alteram os preços com frequência, considere-os uma classificação relativa, não um orçamento. O Lucy Restyle é o mais barato para processamento de vídeos completos. O Kling é o mais preciso para aprimoramento específico de personagens com referências de elementos. O Wan 2.1 é gratuito se você tiver o hardware necessário — cerca de 60 GB de VRAM para o modelo 14B em 720p ou 8 GB para a variante 1.3B, com qualidade inferior.

Tabela comparativa ​

ModeloDuração nativa máximaDuração estendidaTipo de referênciaMáx. de refs.ResoluçãoAPI disponívelCódigo aberto
LongCat Video~15 minN/DApenas primeiro quadro1720p/30fpsSim (fal.ai)Sim (MIT)
Seaweed APT2~5 minN/DI2V + pose1720pNãoNão
HeliosEscala de minutosN/DPrimeiro quadro (I2V)1720pHF SpacesSim (Apache 2.0)
SkyReels V3IlimitadaN/DReferência real1-4720pNãoSim
Kling 3.015s~3 minElementos + refs. de estilo71080pSimNão
Grok Imagine15sEncadeávelReferência real7720pSimNão
Seedance 2.015sN/DRefs. multimodais122KSimNão
Seedance 2.530sExtensão em várias rodadasRefs. multimodais502KSim (BytePlus, Runway)Não
Vidu Q316sN/DReferência real71080pSimNão
MiniMax H315sN/DRefs. multimodais122KSimSim (licença comunitária)
Runway Gen-4.510s~1 minI2V (0-1)11080pSimNão
Veo 3.18s~2,5 minIngredientes (estilo)34KSimNão
Gemini Omni Flash10sEdições conversacionais + extensão (1.1)Refs. multimodaisImagens + vídeo720pSim (GA)Não
Sora 2 Pro ⚠️ será descontinuado20sEncadeávelID de personagem (vídeo)21080pAPI encerrada em set. de 2026Não
Hailuo 0210sN/DI2V (primeiro quadro)11080pSimNão
Luma Ray3.220sN/DQuadros-chave + ref. de personagem16 quadros-chave1080p (upscale para 4K)SimNão
Pika 2.510s25sPikascenes101080pSimNão
Wan 2.1 / 2.2Clipes curtosPor continuaçãoI2V / FLF2V1-2720pVia fal.aiSim (Apache 2.0)
Wan 3.030sN/DRefs. multimodaisImagens, vídeo, áudio1080pSim (Alibaba Cloud)Não
HunyuanVideoClipes curtosPor continuaçãoI2V (primeiro quadro)1720pVia fal.aiSim
LTX-2.320sPor continuaçãoI2V + quadros-chaveVários quadros-chave4KSim (LTX, fal.ai)Pesos (limitados pela ARR)
CogVideoX6-10sPor continuaçãoI2V (primeiro quadro)1720x480Via fal.aiSim

O que está por vir ​

A trajetória ao longo de 2026 é clara. O LongCat Video provou que é possível gerar vídeos com vários minutos e consistência em um modelo aberto. O Helios mostrou que isso pode acontecer em tempo real. O Seaweed APT2 demonstrou a geração interativa de vídeos longos. E os modelos de referência real — Kling, Grok e Seedance — provaram que a identidade dos personagens pode persistir em cenas arbitrárias.

O próximo passo é combinar esses recursos: geração nativa de vídeos longos com verdadeiro suporte a referências de personagens. Hoje, você precisa escolher um ou outro. Quando um modelo conseguir gerar 5 minutos de vídeo mantendo os personagens das imagens de referência em dezenas de mudanças de cena, o fluxo de trabalho com clipes encadeados se tornará obsoleto. O Seedance 2.5 — clipes nativos de 30 segundos, até 50 arquivos de referência, lançado em 31 de julho de 2026 — e o Wan 3.0 — tomadas únicas de 30 segundos a partir de referências multimodais, lançado em agosto de 2026 — são os primeiros passos concretos nessa direção.

No início de setembro de 2026, a arena de texto para vídeo da Artificial Analysis (com áudio) tinha o Gemini Omni Flash, do Google, e o Wan 3.0 da Alibaba, disponível apenas via API, empatados no topo (~1.239 Elo), com o MiniMax H3 Max e o H3 poucos pontos atrás, seguidos pelo Seedance 2.0, Wan 2.7, os modelos HappyHorse, a prévia do MAGI-2 da Sand.ai e o Kling 3.0 Pro completando os dez primeiros. A classificação muda com frequência, então trate qualquer posição isolada como um retrato do momento, não como uma ordem fixa.

A abordagem com estrutura-base 3D oferece uma trajetória paralela. À medida que os modelos V2V melhoram a preservação estrutural e o fotorrealismo, o aprimoramento de renderizações 3D de baixa fidelidade se torna cada vez mais viável para produções completas. O RealMaster da Meta já alcança transformação de simulação para realidade com qualidade de pesquisa em resultados de motores de jogos. Quando esse recurso chegar às APIs de produção com suporte a imagens de referência, qualquer pessoa com conhecimentos básicos de 3D poderá produzir vídeos longos fotorrealistas, de qualquer duração, com controle total sobre câmera, encenação e posicionamento dos personagens.

Por enquanto, a resposta prática depende do seu caso de uso:

Melhor para referências de vários personagens: Kling 3.0 (até 7 refs. com sistemas separados de elementos e estilo), Seedance 2.5 (até 50 entradas multimodais em uma tomada de 30 segundos) ou Vidu Q3 (7 referências marcadas, com troca de câmera dentro do clipe).

Melhor API de referência para vídeo: Grok Imagine (API simples, modo de referência explícito, US$ 0,05/s para o modelo original), Vidu Q3 (tags @, 7 refs.) ou Kling via fal.ai.

Melhor para personagens persistentes em muitos clipes: referências de elementos do Kling 3.0 ou o recurso de referência e extensão do SkyReels V3. (O sistema de ID de personagens do Sora 2 Pro era a abordagem mais simples, mas será descontinuado em 2026; portanto, não inicie novos projetos com ele.)

Melhor opção de código aberto: SkyReels V3 (1 a 4 imagens de referência real, duração ilimitada), MiniMax H3 (9 imagens de referência, além de vídeo e áudio, com licença comunitária sujeita a solicitação regional) ou Helios (tempo real, Apache 2.0).

Melhor para duração bruta: LongCat Video (~15 min, mas apenas com primeiro quadro).

Melhor para aprimorar renderizações 3D: Kling 3.0 V2V (refs. de elementos por personagem, 1080p) ou Lucy Restyle 2 (entrada de 30 min, US$ 0,01/s).


Perguntas frequentes ​

Qual é o melhor modelo de vídeo por IA para vídeos longos? ​

Para duração bruta, o LongCat Video gera cerca de 15 minutos nativamente, embora use apenas o primeiro quadro como referência. Para vídeos longos com personagens consistentes, a resposta prática em 2026 é um fluxo de trabalho de referência e extensão: gere clipes com um modelo que tenha bom suporte a referências — Kling 3.0, Runway Gen-4.5 ou o SkyReels V3 de código aberto — e depois os encadeie. Nenhum modelo, sozinho, gera vídeos longos e preserva perfeitamente a identidade dos personagens; por isso, a maioria das produções combina essas abordagens.

Quais modelos de vídeo por IA aceitam imagens de referência? ​

Entre as opções comerciais, Kling 3.0 Omni, Runway Gen-4.5, Seedance 2.0 e 2.5, Vidu Q3, MiniMax H3, Google Veo 3.1 e Gemini Omni Flash aceitam imagens de referência. Entre as opções de código aberto, SkyReels V2/V3, Wan 2.1 e 2.2, LTX-2.5 e os pesos abertos do MiniMax H3 aceitam entradas de referência que você pode executar por conta própria. A qualidade desse suporte varia muito, razão pela qual o guia acima os divide em categorias.

A IA consegue gerar um personagem consistente ao longo de um vídeo longo? ​

Sim, mas não de uma só vez. A abordagem confiável é fixar um personagem com uma ou mais imagens de referência, gerar clipes curtos e ampliá-los ou uni-los, sempre reutilizando as mesmas referências. O suporte a referências reais — em que o modelo mantém a identidade em novas gerações — é muito mais importante nesse caso do que o condicionamento pelo primeiro quadro, que apenas define o quadro inicial.

Qual é a diferença entre o suporte ao primeiro quadro e o suporte a imagens de referência reais? ​

O condicionamento pelo primeiro quadro usa sua imagem como o quadro inicial literal do clipe e, depois, desvia gradualmente conforme o vídeo avança. O verdadeiro suporte a referências trata a imagem como uma âncora de identidade que o modelo respeita durante toda a geração, para que um personagem ou estilo permaneça consistente ao longo do clipe inteiro e entre clipes separados. A seção acima detalha quais modelos fazem o quê.

Como funciona a conversão de imagem em vídeo do Kling AI com várias imagens de referência? ​

A referência com várias imagens do Kling é um modo separado da conversão comum de imagem em vídeo. Em vez de animar uma imagem como o primeiro quadro, você envia até 7 imagens e elementos (4 se também anexar um vídeo de referência), marca-os no prompt como @Image1 ou @Element1 e descreve a tomada. Elementos são personagens ou objetos fixos criados com até 4 fotos de ângulos diferentes ou um clipe curto, opcionalmente com uma voz vinculada, e persistem no storyboard com várias tomadas do Kling. As regras completas estão na seção sobre o Kling acima, diretamente do guia da própria Kuaishou.

E o Wan 2.2? O Wan 2.5 ou o Wan 3.0 são de código aberto? ​

O Wan 2.2 (julho de 2025) é a versão mais recente do Wan disponível para download, lançada sob a licença Apache 2.0 e baseada em uma arquitetura Mixture-of-Experts, com uma variante 5B que roda em uma RTX 4090 e modelos 14B de texto para vídeo e imagem para vídeo. O Wan 2.5, 2.6, 2.7 e o Wan 3.0 (agosto de 2026, tomadas únicas de 30 segundos em até 1080p) estão disponíveis somente por API no Alibaba Cloud, sem pesos públicos, independentemente do que digam os blogs de afiliados. Se você quiser um fluxo de trabalho com imagens de referência usando pesos abertos, use os modelos de imagem para vídeo e de primeiro e último quadros do Wan 2.2 ou confira o SkyReels V3 e o MiniMax H3.

Qual é a diferença entre imagem para vídeo e referência para vídeo? ​

Imagem para vídeo anima a imagem fornecida, portanto ela é o quadro inicial e o modelo dá continuidade a partir dali. Referência para vídeo usa suas imagens como âncoras de identidade e estilo e gera uma nova tomada a partir do seu prompt, permitindo que um personagem fotografado em um estúdio apareça caminhando por uma floresta. Imagem para vídeo é a opção certa para animar uma imagem estática finalizada. Referência para vídeo é a opção certa para histórias com várias cenas e um personagem consistente. Kling, Vidu Q3, Seedance, Grok Imagine e MiniMax H3 oferecem ambos os modos, e Vidu e Grok os identificam explicitamente em suas APIs.

Quais modelos de vídeo com IA mantêm o mesmo sujeito entre clipes (referência de sujeito)? ​

Para preservar a referência de um sujeito ou personagem em vários clipes, as opções mais avançadas em setembro de 2026 são Kling 3.0 Omni (biblioteca de elementos com fotos de vários ângulos e voz), Seedance 2.5 (até 50 referências e tomadas de 30 segundos), Vidu Q3 (7 sujeitos marcados) e MiniMax H3 (9 imagens de referência, além de vídeo e áudio). O Luma Ray3 adiciona um recurso de referência de personagem, e os IDs de personagem do Sora 2 Pro formavam o sistema mais consistente, mas a API do Sora será desativada em 24 de setembro de 2026. Entre os modelos com pesos abertos, SkyReels V3 e MiniMax H3 são os que oferecem referência de sujeito de verdade.


Conteúdo relacionado ​

Experimente agoraTransforme a cena em uma experiência jogável em vez de renderizada

Pule a fila de renderização e dirija por ela ao vivo.

Criar de graça →É grátis, roda no seu navegador, nada para instalar.