Skip to content

Mejores modelos de vídeo con IA compatibles con imágenes de referencia (2026) ​

Última actualización: septiembre de 2026.

Generar un clip de 10 segundos ahora es fácil. Todos los modelos importantes pueden hacerlo. La verdadera pregunta es: ¿puedes generar 5 o 10 minutos de vídeo coherente en los que un personaje tenga el mismo aspecto en el minuto uno y en el minuto ocho? ¿En los que la escena mantenga su coherencia durante cientos de fotogramas?

Ese es el problema difícil. Y es donde las cosas están cambiando rápidamente. Esta guía abarca todos los modelos que hemos encontrado que generan vídeos largos de forma nativa o que son compatibles con los flujos de trabajo necesarios para crear contenido de larga duración con personajes coherentes mediante imágenes de referencia. Los dividimos en tres niveles: modelos que generan directamente vídeos de varios minutos, modelos con una sólida compatibilidad con imágenes de referencia que puedes ampliar mediante continuaciones y opciones de código abierto que puedes ejecutar por tu cuenta.

Nivel 1: generación nativa de larga duración (varios minutos o más) ​

Estos modelos generan vídeos cuya duración se mide en minutos, no en segundos. Están diseñados desde cero para mantener la coherencia temporal en secuencias largas.

LongCat Video ​

Meituan lanzó LongCat Video a finales de 2025. Es un transformador de difusión con 13.600 millones de parámetros y el primer modelo capaz de generar de forma fiable vídeos coherentes de hasta 15 minutos.

El modelo admite texto a vídeo, imagen a vídeo y continuación de vídeo en un flujo unificado. En el modo I2V, la imagen de entrada se convierte literalmente en el primer fotograma del vídeo. No es una referencia flexible de un personaje que puedas colocar en cualquier escena. El modelo anima a partir de ese fotograma inicial y utiliza «Cross-Chunk Latent Stitching» para seguir consultando la imagen original durante toda la generación, lo que evita las desviaciones de color y mantiene la coherencia visual en secuencias largas. Una variante actualizada de 2026 añade generación de avatares guiada por audio con sincronización labial para vídeos de bustos parlantes de más de 5 minutos.

Internamente, LongCat utiliza un enfoque de generación de grueso a fino con Block Sparse Attention para gestionar las enormes longitudes de secuencia. El ajuste mediante RLHF mejora la calidad del movimiento. En la prueba VBench 2.0 ocupa el tercer puesto general, por detrás de Google Veo 3 y Vidu Q1 de Shengshu.

Disponibilidad: Código abierto bajo licencia MIT. Disponible mediante la API de fal.ai por 0,04 USD por segundo generado (36 USD por un vídeo de 15 minutos a 720p). También está disponible a través de la plataforma de LongCat, con precios basados en créditos.

EspecificaciónValor
Duración máxima~15 minutos
Resolución720p a 30 fps
Parámetros13.600 millones
Imágenes de referenciaSolo el primer fotograma (modo I2V, no como referencia de personaje)
LicenciaMIT
Coste de la API~0,04 USD/segundo (fal.ai)

Seaweed APT2 ​

Seaweed APT2 de ByteDance adopta un enfoque diferente. En lugar de generar un vídeo completo de antemano, produce fotogramas autorregresivamente a 24 fps, con una latencia de solo 0,16 segundos por fotograma en una única H100. El resultado es un vídeo estable de hasta 5 minutos que mantiene la coherencia temporal.

El recurso técnico es el posentrenamiento adversarial autorregresivo (Autoregressive Adversarial Post-Training, AAPT), que convierte un modelo preentrenado de difusión de vídeo bidireccional en un generador autorregresivo unidireccional. Solo realiza una evaluación hacia delante de la red por fotograma. Eso es lo que hace posible la generación en tiempo real.

Más allá de la duración, lo que hace interesante a este modelo es su interactividad. Puedes controlar la cámara, animar personajes mediante detección de poses y manipular escenas mientras se renderiza el vídeo. No lo veas tanto como «generar un vídeo», sino como «dirigir un vídeo en tiempo real».

Disponibilidad: Solo en fase de investigación. Todavía no está disponible públicamente. El modelo base de 7.000 millones de parámetros (Seaweed-7B) cuenta con un artículo publicado, pero los pesos de APT2 no se han publicado.

EspecificaciónValor
Duración máxima~5 minutos
Resolución736x416 (una GPU), hasta 720p (8 GPU)
Parámetros8.000 millones
Imágenes de referenciaMediante I2V y control interactivo de poses
LicenciaNo publicado
EstadoVersión preliminar de investigación

Helios ​

Helios procede de la Universidad de Pekín y está construido sobre Wan 2.1. Es un modelo de 14.000 millones de parámetros que genera vídeos de varios minutos a 19,5 FPS en una única H100. La innovación clave es cómo gestiona la deriva en vídeos largos. En lugar de utilizar técnicas convencionales contra la deriva, como self-forcing o muestreo de fotogramas clave, Helios simula la deriva durante el entrenamiento para que el modelo aprenda a corregirla.

Admite de forma nativa tareas de texto a vídeo, imagen a vídeo y vídeo a vídeo. El modo I2V acepta imágenes de referencia para iniciar la generación.

Disponibilidad: Completamente de código abierto bajo Apache 2.0. Publicado en marzo de 2026. Código y pesos en GitHub (PKU-YuanGroup/Helios). Integrado en Diffusers, SGLang y vLLM-Omni. Demostración de Gradio en HuggingFace Spaces.

EspecificaciónValor
Duración máximaVarios minutos (sin límite fijo)
Resolución720p
Parámetros14.000 millones
Imágenes de referenciaSí (modo I2V)
LicenciaApache 2.0
HardwareUna sola H100 para tiempo real

SkyReels V2 / V3 ​

SkyReels V3 acepta entre 1 y 4 imágenes de referencia y genera vídeos de duración ilimitada con cambios entre múltiples planos y síntesis de avatares guiada por audio.

La línea SkyReels de Skywork aspira a generar vídeos de duración infinita. V2 utiliza una arquitectura AutoRegressive Diffusion-Forcing que genera vídeo sin un límite fijo de duración. V3, publicada en enero de 2026, unifica la conversión de imágenes de referencia a vídeo, la extensión de vídeo a vídeo y la generación de avatares guiada por audio en un solo modelo.

V3 acepta entre 1 y 4 imágenes de referencia y conserva la identidad del sujeto durante todo el vídeo generado. El modo de vídeo a vídeo permite continuaciones fluidas de un solo plano y cambios entre múltiples planos con transiciones cinematográficas.

Skywork anunció SkyReels V4 el 25 de febrero de 2026, un modelo de doble flujo que genera vídeo y audio conjuntamente a un máximo de 1080p/32 fps y acepta texto, imágenes, clips de vídeo, máscaras y audio como entradas de condicionamiento. Una corrección respecto a nuestro artículo de julio: V4 no se ha publicado como código abierto. A septiembre de 2026, la organización SkyworkAI en GitHub cuenta con repositorios de V1 a V3 y de Matrix-Game, pero no hay pesos de V4 ni una API pública, por lo que V3 sigue siendo el modelo abierto más avanzado de Skywork para generar vídeo a partir de referencias.

Disponibilidad: Completamente de código abierto. Modelos de entre 1.300 y 14.000 millones de parámetros. Disponibles a 540p y 720p. Código y pesos en GitHub y HuggingFace.

EspecificaciónValor
Duración máximaIlimitada (autorregresiva)
Resolución540p, 720p
Parámetros1.300 millones, 5.000 millones, 14.000 millones
Imágenes de referenciaEntre 1 y 4 imágenes (V3)
LicenciaCódigo abierto
HardwareMínimo RTX 4090; se recomiendan entre 4 y 8 A100

Nivel 2: clips cortos con referencias sólidas y extensión ​

Estos modelos generan clips de entre 8 y 60 segundos, pero ofrecen una sólida compatibilidad con imágenes de referencia y funciones de extensión de vídeo. Para crear contenido de larga duración, puedes encadenar clips utilizando los endpoints de continuación o extensión del modelo. La coherencia de los personajes procede de imágenes de referencia que persisten entre generaciones.

Este es el flujo de trabajo práctico que la mayoría de los creadores utilizan actualmente para contenido de más de un minuto. La calidad de cada clip suele ser superior a la de los modelos nativos de larga duración.

Kling 3.0 Omni (Kuaishou) ​

Kling 3.0 Omni combina elementos de personajes, referencias de estilo y guion gráfico con múltiples planos en una sola llamada, con salida nativa en 4K a 60 fps.

Kling tiene el sistema de imágenes de referencia más completo de todos los modelos de vídeo. Separa las entradas de referencia en tres categorías distintas, cada una con una finalidad diferente:

Imágenes de referencia (image_urls): Hasta 4 imágenes para orientar el estilo y la apariencia. Las etiquetas en el prompt como @Image1, @Image2, etc. Influyen en el aspecto general, el estilo de la escena y el entorno sin convertirse en el primer fotograma.

Elementos (elements): Entradas dedicadas a personajes u objetos. Cada elemento utiliza una frontal_image_url (una foto frontal clara), además de reference_image_urls opcionales (ángulos adicionales). Haces referencia a ellos como @Element1, @Element2 en el prompt. El modelo extrae la identidad del personaje y lo coloca en cualquier escena que describas. Esta es la función clave para crear contenido al estilo de las películas de aventuras: sube la foto de un personaje y después descríbelo caminando por un bosque, luchando contra un dragón o haciendo cualquier otra cosa que quieras.

Fotogramas inicial/final (start_image_url, end_image_url): Fijan imágenes concretas como primer o último fotograma. Son fotogramas literales, no guías de estilo.

El total entre las tres categorías es de hasta 7 entradas de referencia (se reduce a 4 cuando también se utiliza un vídeo de referencia). Un solo prompt como "@Element1 y @Element2 están cenando en esta mesa de @Image1" puede combinar personajes con referencias de escenas.

Para el contenido de larga duración, Kling ofrece dos vías. El modo de múltiples planos genera hasta 6 escenas en una sola llamada, cada una con su propio prompt y duración (entre 3 y 15 segundos cada una). Los elementos de personajes se mantienen automáticamente en todos los planos. La API de extensión continúa desde el punto en el que terminó un vídeo completo y puede alcanzar unos 3 minutos mediante extensiones encadenadas. El modo de edición V2V toma un vídeo existente (de entre 3 y 10 segundos) y lo transforma mediante referencias de elementos y un prompt de texto, conservando el movimiento de cámara y la puesta en escena de los personajes del material original, pero modificando el estilo de los personajes y los entornos según tus referencias. Esto hace que Kling resulte especialmente útil para mejorar material preexistente, incluidos renders 3D de baja fidelidad.

Kling 3.0 Omni unifica texto a vídeo, imagen a vídeo, referencia a vídeo y edición de vídeo en un único modelo, con generación de audio nativa y sincronización labial. En junio de 2026, Kuaishou añadió Kling 3.0 Turbo, una variante más rápida y barata con audio incluido a 720p y 1080p, y actualizó el flujo de edición de Omni para aceptar y producir vídeos 4K. A septiembre de 2026 no se ha lanzado Kling 3.5 ni 4.0, por lo que 3.0 Omni sigue siendo el modelo de vídeo actual.

Disponibilidad: API comercial mediante Kuaishou, fal.ai y Replicate, con precios por segundo que varían según la resolución y la variante. Interfaz web en klingai.com.

EspecificaciónValor
Duración nativa del clip3-15 segundos
Duración ampliada~3 minutos (mediante extensiones encadenadas)
Resolución720p, 1080p (4K en la edición con Omni)
Imágenes de referenciaHasta 4 (referencias de estilo @Image)
ElementosHasta 4 (referencias de personajes @Element con vista frontal y otros ángulos)
Referencias totalesHasta 7 combinadas (4 con referencia de vídeo)
Múltiples planosSí (hasta 6 planos en el guion gráfico)
AudioAudio sincronizado nativo + sincronización labial
Edición de vídeoSí (edición de vídeo existente guiada por texto)
APIKuaishou, fal.ai, Replicate

Kling de imagen a vídeo con varias imágenes de referencia ​

Esta es la pregunta que más recibimos sobre Kling, así que aquí tienes una versión resumida de cómo funcionan las referencias de varias imágenes en el modelo actual, extraída de la propia guía de VIDEO 3.0 Omni de Kling. La conversión estándar de imagen a vídeo toma una imagen y la anima como primer fotograma. La referencia de varias imágenes es un modo diferente: subes varias imágenes, las etiquetas en el prompt y el modelo compone un nuevo plano a partir de ellas. Si la solicitud no incluye un vídeo de referencia, puedes adjuntar hasta 7 imágenes y elementos combinados; si incluye un vídeo de referencia, el límite se reduce a 4. Un solo elemento de personaje puede crearse con hasta 4 fotos tomadas desde distintos ángulos o con un clip de vídeo de entre 3 y 8 segundos que muestre a un único personaje. También puedes vincularle una grabación de voz de entre 5 y 30 segundos para que el personaje mantenga la misma voz entre planos. En el prompt haces referencia a ellos como @Image1 para una referencia de estilo o escena y como @Element1 (o el nombre que hayas asignado al elemento) para un personaje u objeto fijo. Así, un prompt como «@Grace camina por @Image1 al anochecer» coloca un personaje coherente en una escena que hayas proporcionado. El resultado puede durar hasta 15 segundos a 720p o 1080p con audio nativo, y la misma biblioteca de elementos se transfiere al guion gráfico con múltiples planos de Kling, que es como se mantiene un mismo personaje a lo largo de una secuencia de seis planos. Si solo necesitas imágenes estáticas coherentes en lugar de vídeo, Kling IMAGE 3.0 acepta hasta 10 imágenes de referencia, según su guía de imágenes, y un flujo de trabajo habitual consiste en fijar primero el personaje allí y después utilizar esas imágenes estáticas como elementos.

Grok Imagine (xAI) ​

Grok Imagine separa el modo de referencia del modo de primer fotograma, lo que te permite etiquetar hasta 7 imágenes como referencias de personajes u objetos en el prompt.
xAI lanzó el modo de referencia a vídeo de Grok Imagine a principios de 2026, compatible con entre 1 y 7 imágenes de referencia. La documentación lo distingue explícitamente de la conversión de imagen a vídeo: «A diferencia de la conversión de imagen a vídeo, donde la imagen de origen se convierte en el fotograma inicial, las imágenes de referencia influyen en lo que aparece en el vídeo sin fijar el primer fotograma».

Etiquetas las imágenes en el prompt como <IMAGE_1>, <IMAGE_2>, etc. Un prompt como "la modelo de <IMAGE_1> entra en la pasarela llevando la camiseta de <IMAGE_2>" combina la referencia de una persona con la de una prenda. El modelo permite realizar pruebas virtuales de ropa, emplazamiento de productos y narraciones con personajes coherentes entre escenas.

Una restricción: no puedes combinar imágenes de referencia con la conversión de imagen a vídeo en una misma solicitud. Debes elegir entre el modo de primer fotograma y el modo de referencia; no se pueden usar ambos.

Grok Imagine también dispone de un endpoint de extensión de vídeo que añade nuevas secuencias al final de un vídeo existente. El parámetro duration controla únicamente la parte nueva. Puedes encadenar extensiones para crear contenido más largo.

xAI lanzó Grok Imagine 1.5 como versión preliminar de la API el 3 de junio de 2026 y lo pasó a disponibilidad general como grok-imagine-video-1.5 el 16 de junio, mientras una variante Fast comenzaba a llegar a las aplicaciones de consumo. Es un modelo de imagen a vídeo que convierte una sola imagen estática en movimiento cinematográfico con desplazamientos de cámara, atmósfera, física y audio sincronizado generado de forma nativa en la misma pasada de inferencia. Admite secuenciación multitoma para encadenar escenas coherentes, genera un clip de 6 segundos a 720p en unos 25 segundos y ocupaba el tercer puesto en la clasificación de imagen a vídeo de Artificial Analysis en el momento de su lanzamiento. En septiembre de 2026, la página de modelos de xAI muestra Grok Imagine Video 1.5 a $0,08 por segundo y el Grok Imagine Video original a $0,05 por segundo. El modelo más reciente Grok Imagine Image 2.0 de xAI (incluido en sus notas de la versión) es un modelo de imagen estática, útil para fijar un personaje antes de animarlo, pero no es un modelo de vídeo nuevo.

Disponibilidad: API de xAI (lanzada en enero de 2026), fal.ai y Replicate. SDK para Python, JavaScript/AI SDK y API REST. $0,05/s a 720p con audio. También disponible para los suscriptores de X Premium.

EspecificaciónValor
Duración nativa del clip1-15 segundos
Duración extendidaSe pueden encadenar extensiones mediante la API de extensión
Resolución480p, 720p
Imágenes de referencia1-7 (referencias reales, no primer fotograma)
Etiquetas del prompt<IMAGE_1>, <IMAGE_2>, etc.
AudioSí (720p)
Edición de vídeoSí (guiada por texto)
APIAPI de xAI, fal.ai, Replicate
Coste de la API$0,05/segundo (Video), $0,08/segundo (Video 1.5)

Seedance 2.0 (ByteDance) ​

Seedance 2.0 admite hasta 12 entradas multimodales simultáneas y genera vídeo con sincronización de audio nativa y sincronización labial a nivel de fonema en más de 8 idiomas.

Seedance 2.0 de ByteDance admite más entradas de referencia que cualquier otro modelo: hasta 12 archivos simultáneamente, incluidas hasta 9 imágenes, 3 vídeos y 3 archivos de audio. El modelo permite generar audio y vídeo de forma nativa con sincronización labial a nivel de fonema en más de 8 idiomas.

Cada imagen puede ocupar hasta 30 MB. Los vídeos de referencia deben durar entre 2 y 15 segundos. El modelo utiliza las referencias para definir la apariencia de los personajes, el estilo de las escenas y el movimiento.

El siguiente gran salto ya está disponible. ByteDance anunció Seedance 2.5 en su conferencia FORCE de Volcano Engine el 23 de junio de 2026 y lo lanzó el 31 de julio de 2026. Según el anuncio del equipo de Seed, genera un único clip nativo de hasta 30 segundos con extensiones en varias rondas, admite hasta 30 imágenes, 10 clips de vídeo y 10 clips de audio como referencias en una sola pasada (50 archivos, frente a los 12 anteriores) y añade edición a nivel de marca de tiempo para poder cambiar un momento concreto de un clip sin regenerarlo. Llegó primero a Jimeng y Doubao, después a la API empresarial ModelArk de BytePlus, y los proveedores externos no tardaron en incorporarlo: la API de Runway añadió Seedance 2.5 el 7 de agosto de 2026 con duraciones de entre 4 y 30 segundos y hasta 30 imágenes de referencia, según el registro de cambios de Runway. Para el flujo de trabajo narrativo de esta guía, una sola toma de 30 segundos con 50 referencias elimina gran parte de la concatenación de clips descrita más adelante.

Disponibilidad: API oficial de ByteDance (mediante Volcengine, lanzada en febrero de 2026) y proveedores externos de API. Salida de 480p-720p mediante API y resolución cinematográfica de hasta 2K a través de la plataforma.

EspecificaciónValor
Duración nativa del clip4-15 segundos
ResoluciónHasta 2K (cine)
Imágenes de referenciaHasta 9 imágenes + 3 vídeos + 3 audios (12 en total)
Duración de los clips de Seedance 2.5Hasta 30 segundos nativos, con extensiones
Referencias de Seedance 2.5Hasta 30 imágenes + 10 vídeos + 10 audios (50 en total)
AudioNativo con sincronización labial (más de 8 idiomas)
APIByteDance/Volcengine, BytePlus ModelArk (2.5), API de Runway (2.5), proveedores externos

Runway Gen-4.5 ​

Runway Gen-4.5 se lanzó en lo más alto de la clasificación de texto a vídeo de Artificial Analysis con 1247 puntos ELO, por delante de Veo 3 y Sora 2 Pro en aquel momento. Para septiembre de 2026, la clasificación había cambiado (Gemini Omni Flash y Wan 3.0 de Alibaba comparten el primer puesto, mientras que Gen-4.5 está fuera de los diez primeros), pero Gen-4.5 sigue siendo un modelo sólido por su calidad cinematográfica y sus acciones controlables, y Runway no ha lanzado un Gen-5. El modelo genera clips de entre 2 y 10 segundos a partir de texto y admite vídeos largos de hasta un minuto con personajes coherentes mediante secuenciación multitoma.

La conversión de imagen a vídeo se añadió a principios de 2026 y admite imágenes de referencia para todas las relaciones de aspecto. Los demás avances de Runway durante 2026 se centraron en la edición y el enrutamiento, no en un nuevo modelo base: Aleph 2.0 (2 de junio de 2026) edita un vídeo existente de entre 2 y 30 segundos a partir de un prompt de texto y hasta 5 imágenes de fotogramas clave fijadas a marcas de tiempo; Gen-3 Alpha Turbo y el Gen-4 Aleph original se retiraron de la API el 30 de julio de 2026; y la API ahora también ofrece modelos de terceros, incluidos Gemini Omni Flash y Seedance 2.5, todo ello según el registro de cambios de Runway. El modelo integra campos de radiancia neuronal y splatting gaussiano dentro de la arquitectura de difusión, lo que le proporciona comprensión geométrica 3D en lugar de limitarse a la predicción a nivel de píxel. Esto se traduce en una mayor permanencia de los objetos y movimientos físicamente plausibles.

Disponibilidad: API comercial e interfaz web. SDK para Node y Python. También disponible en Replicate.

EspecificaciónValor
Duración nativa del clip2-10 segundos
Modo de larga duraciónHasta ~1 minuto
ResoluciónHasta 1080p
Imágenes de referencia0-1 por generación
AudioGeneración de audio nativo
MultitomaSí
APISí (Runway, Replicate)

Google Veo 3.1 ​

Veo 3.1 de Google genera de forma nativa clips de 4, 6 u 8 segundos. La función «Extend Video» (actualmente en versión preliminar) encadena clips para alcanzar aproximadamente entre 1 y 2,5 minutos, aunque la coherencia puede deteriorarse en secuencias más largas.

La función «Ingredients to Video» admite hasta 3 imágenes de referencia como entrada. Puedes proporcionar personajes para animar, fondos y texturas de materiales. Cuando utilizas imágenes de referencia, el modelo se ciñe más a tus referencias visuales y realiza menos cambios aleatorios. Una limitación: el modo de imágenes de referencia solo funciona con la opción de 8 segundos.

En enero de 2026, Veo 3.1 añadió vídeo vertical (9:16) para la generación basada en referencias y reescalado a 4K en Vertex AI. Google continuó con Veo 3.1 Lite el 31 de marzo de 2026 como su modelo de vídeo más económico, retiró Veo 2.0 y 3.0 el 30 de junio de 2026 y, en septiembre de 2026, no había anunciado Veo 4, según el registro de cambios de la API de Gemini. Sus trabajos más recientes en vídeo se están incorporando a Gemini Omni Flash, descrito a continuación.

Disponibilidad: API de Google Vertex AI, API de Gemini y Google Flow. Requiere una cuenta de Google Cloud.

EspecificaciónValor
Duración nativa del clip4, 6 u 8 segundos
Duración extendida~1-2,5 minutos
ResoluciónHasta 4K (con reescalado)
Imágenes de referenciaHasta 3 («Ingredients to Video»)
AudioDiálogo y música sincronizados
APIVertex AI, API de Gemini

Google Gemini Omni Flash ​

Google anunció la familia Gemini Omni en I/O en mayo de 2026 y lanzó Gemini Omni Flash como su primer modelo. Rápidamente alcanzó el primer puesto en la clasificación de Artificial Analysis, por delante de Veo 3.1. Su propuesta es el vídeo conversacional: generas un clip de 10 segundos a partir de texto, imágenes o vídeo y después lo editas mediante instrucciones sucesivas que se basan unas en otras. Cambia la iluminación, sustituye un atuendo o ajusta la cámara, todo ello sin regenerar desde cero.

En cuanto a las referencias, Omni Flash admite imágenes y clips de vídeo cortos como referencias de estilo, movimiento y efectos, y está previsto que incorpore referencias de audio. La coherencia de los personajes se mantiene durante las ediciones conversacionales, aunque la propia documentación de Google señala que puede fallar durante los cambios de escena y los paneos de cámara, por lo que conviene revisar los resultados centrados en personajes antes de publicarlos.

Disponibilidad: La API (gemini-omni-flash-preview) se abrió en versión preliminar pública el 30 de junio de 2026 mediante Google AI Studio y la API de Gemini, a aproximadamente $0,10 por segundo de salida, y gemini-omni-1.1-flash alcanzó la disponibilidad general el 27 de agosto de 2026 con controles de extensión de vídeo, interpolación y resolución, según el registro de cambios de la API de Gemini. Todos los clips incluyen una marca de agua SynthID. El acceso para consumidores se realiza mediante la aplicación Gemini, Google Flow y YouTube Shorts, y la API de Runway también ofrece acceso al modelo.

EspecificaciónValor
Duración nativa del clip10 segundos (se prevén duraciones mayores)
Resolución720p
Entradas de referenciaImágenes + clips de vídeo cortos (audio previsto)
EdiciónConversacional e iterativa
AudioNativo
APIAPI de Gemini (disponibilidad general como gemini-omni-1.1-flash), ~$0,10/s

OpenAI Sora 2 / Sora 2 Pro ​

En proceso de retirada (2026): OpenAI está descontinuando Sora. La aplicación Sora para consumidores cerró el 26 de abril de 2026 y la API de Sora 2 dejará de estar disponible el 24 de septiembre de 2026, sin que se haya anunciado un sucesor, según la página de productos obsoletos de OpenAI. Las capacidades descritas a continuación siguen siendo destacables, pero no desarrolles una nueva canalización con Sora. Utiliza Kling, Grok Imagine o un modelo abierto en su lugar.

Sora 2 Pro genera clips de hasta 20 segundos. La API de Characters adopta un enfoque diferente al de Kling o Grok: en lugar de subir imágenes estáticas, creas un character_id indicando a la API un clip de vídeo (con un intervalo de marcas de tiempo de entre 1 y 3 segundos). Sora analiza los fotogramas del vídeo para extraer la estructura facial, las proporciones corporales, el estilo de la ropa y otros rasgos identificativos. Ese character_id se conserva indefinidamente y puede reutilizarse en un número ilimitado de generaciones futuras.

Puedes usar como referencia hasta 2 personajes subidos por generación. Desde marzo de 2026, las referencias de personajes también funcionan con objetos y animales, no solo con personas. La extensión de vídeo utiliza todo el clip inicial como contexto para la continuación.

El sistema de personajes requiere una entrada de vídeo —no imágenes estáticas— para crear personajes. Si solo tienes fotografías, primero tendrás que generar un vídeo corto y después extraer de él el personaje.

Disponibilidad: API de OpenAI compatible con Batch API para flujos de trabajo de producción.

EspecificaciónValor
Duración nativa del clipHasta 20 segundos
ResoluciónHasta 1920x1080
Referencias de personajesHasta 2 por generación (character_id persistente)
Entrada de personajeClip de vídeo (intervalo de marcas de tiempo de 1-3 s), no imágenes estáticas
AudioSincronizado
ExtensiónSí (clip completo como contexto)
APIAPI de OpenAI + Batch API

MiniMax Hailuo 02 ​

Hailuo 02 ocupó el segundo puesto mundial en la prueba de referencia de Artificial Analysis en el momento de su lanzamiento, superando a Veo 3. Genera clips de 10 segundos a 1080p nativo con una de las mejores simulaciones físicas del sector. El modelo maneja movimientos extremos, como gimnasia y acrobacias, sin que la imagen se descomponga.

Admite la generación de imagen a vídeo con una gran coherencia de personajes gracias al reconocimiento facial y al seguimiento corporal. La arquitectura Noise-aware Compute Redistribution asigna recursos de cómputo dinámicamente según la complejidad de la escena.

Desde entonces, MiniMax ha superado Hailuo 02 con la familia Hailuo 2.3 (Standard, Pro, Fast y Fast Pro), que mejora las acciones físicas, la estilización y las microexpresiones de los personajes. Genera vídeo a 1080p durante 6 segundos o a 768p durante 10 segundos y está disponible a través de la plataforma de MiniMax y fal.ai.

Disponibilidad: API comercial. Disponible mediante la plataforma de MiniMax, fal.ai y Replicate. $0,28 por vídeo.

EspecificaciónValor
Duración nativa del clipHasta 10 segundos
Resolución1080p nativo
Imágenes de referenciaSí (modo I2V)
AudioNo nativo
FísicaSimulación líder en su categoría
APIMiniMax, fal.ai, Replicate

MiniMax H3 (Hailuo 3.0) ​

MiniMax sustituyó la línea Hailuo 2.x por MiniMax H3 el 31 de julio de 2026, lo que cambia la posición de Hailuo en esta guía. Mientras que Hailuo 02 era un modelo de primer fotograma, H3 es un modelo omnimodal: un único transformer procesa conjuntamente texto, imágenes, vídeo y audio, y devuelve un clip de entre 4 y 15 segundos con una resolución de hasta 2K y audio estéreo nativo, según el anuncio de MiniMax. Su modo de referencia (Ref2VA) admite hasta 9 imágenes de referencia, 3 clips de vídeo de referencia y 3 clips de audio, con un límite de 12 archivos, lo que lo sitúa en la misma categoría de referencias reales que Kling y Seedance 2.0; además, un modo de primer y último fotograma (FL2VA) cubre el flujo de trabajo clásico con fotogramas clave. En la clasificación de texto a vídeo de Artificial Analysis, las entradas H3 y H3 Max se encuentran justo detrás de Omni Flash y Wan 3.0 en septiembre de 2026. La gran noticia para quienes alojan sus propios modelos es que MiniMax publicó los pesos base de 33B en agosto de 2026 en Hugging Face, con puntos de control tanto FL2VA como Ref2VA. La licencia es la MiniMax H3 Community License, y la ficha del modelo pide a los usuarios de EE. UU., la UE, el Reino Unido y Corea del Sur que envíen un formulario de solicitud antes de usarlo, por lo que es abierto con un asterisco regional, en lugar de tener una apertura al estilo Apache.

Disponibilidad: API y plataforma de MiniMax, fal.ai y otros proveedores, además de pesos descargables.

EspecificaciónValor
Duración nativa del clip4-15 segundos
ResoluciónHasta 2K (768p de lado corto de forma predeterminada)
Imágenes de referenciaHasta 9 imágenes + 3 vídeos + 3 audios (12 en total, Ref2VA)
Fotogramas clavePrimer y/o último fotograma (FL2VA)
AudioEstéreo nativo, 32 kHz
Pesos abiertosSí, 33B, MiniMax H3 Community License (solicitud para EE. UU./UE/Reino Unido/Corea del Sur)
APIMiniMax, fal.ai

Luma Ray3.2 ​

Ray2 de Luma ha sido sustituido por la familia Ray3. Ray3 (septiembre de 2025) añadió Character Reference para fijar la identidad y un modo Modify de vídeo a vídeo, y Ray3.2 (9 de junio de 2026) incorporó control a nivel de fotograma con hasta 16 fotogramas clave por clip, una función Reframe y clips de hasta 20 segundos, además de la primera API pública de la línea Ray3. La salida es 1080p nativa, con 4K disponible mediante escalado Hi-Fi. La conversión de imagen a vídeo admite imágenes de referencia como fotogramas clave iniciales o finales.

Disponibilidad: API e interfaz web de Luma.

EspecificaciónValor
Duración nativa del clipHasta 20 segundos (Ray3.2)
Tipo de referenciaFotogramas clave iniciales/finales + Character Reference (identidad)
Resolución1080p nativa, 4K mediante escalado
Imágenes de referenciaSí (fotogramas clave + referencia de personaje)
APIAPI de Luma

Pika 2.5 ​

Pika adopta un enfoque basado en fotogramas clave con Pikaframes. Sube entre 2 y 5 fotogramas clave (imágenes de referencia en momentos importantes) y el modelo genera transiciones fluidas entre ellos. La duración total alcanza los 20-25 segundos.

Pikascenes admite hasta 10 imágenes de referencia y las combina en un solo vídeo. El modelo usa reconocimiento de imágenes para determinar automáticamente el papel de cada referencia (personaje, fondo, objeto de atrezo).

Disponibilidad: Plataforma web y API de Pika. Planes de suscripción desde el gratuito hasta Pro.

EspecificaciónValor
Duración nativa del clip5-10 segundos
Duración de Pikaframes20-25 segundos
ResoluciónHasta 1080p
Imágenes de referenciaHasta 10 (Pikascenes), 2-5 fotogramas clave (Pikaframes)
APISí

Vidu Q3 (ShengShu) ​

Vidu merece una sección que no tenía en versiones anteriores de esta guía, porque su línea Q3 se ha convertido en uno de los sistemas de referencia de sujetos más potentes disponibles. ShengShu lanzó Vidu Q3 a principios de 2026 con audio nativo y clips de hasta 16 segundos, y el 13 de abril de 2026 añadió Q3 Reference-to-Video, según su anuncio de lanzamiento. El modo de referencia combina sujetos, entornos, vestuario, objetos de atrezo y estilos visuales en una sola solicitud. Según la documentación de la API de Vidu, el endpoint reference2video acepta hasta 7 imágenes de referencia, que se etiquetan en el prompt como @1, @2, etc. («@1 y @2 están cocinando juntos»); las duraciones van de 3 a 16 segundos en viduq3, la resolución llega a 1080p y la generación de audio se controla mediante un indicador. También realiza cambios de cámara inteligentes dentro de un único clip, algo poco habitual y útil para escenas de diálogo. ShengShu afirma que Q3 encabezó la primera clasificación Reference-to-Video de SuperCLUE, y Vidu ya era el modelo que rivalizaba con Veo en VBench 2.0 cuando escribimos esta guía por primera vez.

Disponibilidad: Aplicación web y API de Vidu (viduq3, viduq3-turbo), además de Alibaba Cloud Model Studio y proveedores externos.

EspecificaciónValor
Duración nativa del clip3-16 segundos
ResoluciónHasta 1080p
Imágenes de referenciaHasta 7 (etiquetas @1, @2)
Tipos de referenciaSujetos, entornos, objetos de atrezo, vestuario, estilos
AudioNativo (efectos de sonido, diálogo, música)
APIAPI de Vidu, Alibaba Cloud Model Studio

Nivel 3: Modelos de código abierto para flujos de trabajo autoalojados ​

Estos modelos generan clips más cortos, pero son totalmente abiertos. Puedes ejecutarlos en tu propio hardware, afinarlos y crear pipelines de extensión personalizados sin depender de API.

Wan 2.1 (Alibaba) ​

Wan 2.1 es la base sobre la que se construyen varios modelos más (incluido Helios). La arquitectura Wan-VAE codifica y decodifica vídeo 1080p de cualquier duración mientras conserva la información temporal. El modelo está disponible en variantes I2V a 480p y 720p, además de un modelo First-Last-Frame-to-Video que genera vídeo entre dos imágenes de referencia.

Wan-Edit permite transferir estilo y contenido mediante imágenes de referencia, a la vez que mantiene estructuras o poses específicas de los personajes. Wan 2.2 (julio de 2025) es la versión abierta más reciente, un modelo Mixture-of-Experts con una variante de 5B que funciona en una sola RTX 4090 y sigue estando bajo Apache 2.0. Una salvedad importante para quienes alojan sus propios modelos: Wan pasó a ser cerrado a partir de la versión 2.5. Los posteriores Wan 2.5, 2.6, 2.7 y ahora Wan 3.0 añadieron audio sincronizado y mayor resolución, pero solo están disponibles mediante API y no tienen pesos públicos, por lo que 2.2 sigue siendo el límite de la versión abierta. Wan 3.0 llegó en agosto de 2026 a Alibaba Cloud Model Studio y, según su página del modelo, genera hasta 30 segundos en una sola toma a 480p, 720p o 1080p a partir de referencias de texto, imagen, vídeo y audio. Además, en septiembre de 2026 comparte con Gemini Omni Flash el primer puesto de la clasificación de texto a vídeo de Artificial Analysis. Es un producto alojado, no una descarga. Ignora las páginas creadas para SEO que afirman que los pesos de Wan 2.7 o 3.0 se pueden descargar. La organización oficial de GitHub y la cuenta de Hugging Face solo llegan hasta 2.2 (las cargas más recientes son actualizaciones de Wan2.2-Animate).

EspecificaciónValor
Parámetros1.3B, 5B, 14B (2.1); 5B + 14B MoE (2.2)
Modos I2VI2V-480P, I2V-720P, FLF2V-720P
Límite abiertoWan 2.2 (de 2.5 a 3.0 solo están disponibles mediante API)
LicenciaApache 2.0
Hardware8GB+ de VRAM (variantes más pequeñas)
PlataformasDiffusers, ComfyUI

HunyuanVideo (Tencent) ​

El modelo de 13B parámetros de Tencent fue el líder de la generación de vídeo de código abierto durante la mayor parte de 2025. HunyuanVideo-I2V utiliza una técnica de sustitución de tokens con un MLLM preentrenado para incorporar información de imágenes de referencia. HunyuanVideo-1.5, publicado en noviembre de 2025, mejoró la eficiencia. HunyuanCustom permite generar vídeos personalizados mediante entradas multimodales.

EspecificaciónValor
Parámetros13B
I2VSí (técnica de sustitución de tokens)
LicenciaCódigo abierto
Hardware60GB+ de VRAM (720p)
VariantesBase, I2V, 1.5, Avatar, Custom

LTX-2 (Lightricks) ​

Lightricks publicó LTX-2 como código abierto en enero de 2026, con los pesos completos y el código de inferencia y entrenamiento. Es un modelo basado en DiT que genera vídeo y audio sincronizado a la vez en una sola pasada, a 4K nativo y hasta 50fps, con clips de hasta 20 segundos. La conversión de imagen a vídeo y el condicionamiento mediante varios fotogramas clave vienen integrados, por lo que puedes fijar imágenes de referencia en distintos puntos del clip, como harías con Pikaframes.

La licencia es el inconveniente, o quizá no, dependiendo de tu tamaño. LTX-2 es gratuito para investigación y uso comercial por debajo de $10M de ingresos anuales. Por encima de esa cifra necesitas una licencia comercial, así que se trata de pesos abiertos y no de código abierto en sentido estricto. LTX-2.3 fue una actualización de 22B parámetros con mejor audio y seguimiento del prompt, y LTX-2.5, el punto de control actual en septiembre de 2026, mantiene el tamaño de 22B y añade generación multiptoma nativa que conserva el mismo personaje y aspecto en varias tomas conectadas, un decodificador de vídeo por difusión en lugar de una reconstrucción VAE convencional y un codificador de texto Gemma 4 12B para prompts largos. Sigue bajo la LTX-2.x Community License, con el mismo límite de ingresos de $10M. Los pesos están en Hugging Face junto con variantes destiladas, adaptadores LoRA e integraciones con ComfyUI y Diffusers; las API alojadas funcionan en la plataforma LTX, fal.ai y Replicate.

EspecificaciónValor
Parámetros22B (LTX-2.3 y LTX-2.5)
Clip máximo~20 segundos
Resolución4K nativo a hasta 50fps
AudioSincronizado de forma nativa
I2VSí (imagen + condicionamiento mediante varios fotogramas clave)
LicenciaLTX-2 Community License (gratuita por debajo de $10M de ingresos anuales recurrentes)
HardwareVariantes destiladas y FP8 para GPU de consumo

CogVideoX (Tsinghua/Zhipu AI) ​

CogVideoX utiliza un VAE causal 3D que reduce la longitud de la secuencia y evita el parpadeo. El transformador con LayerNorm adaptativo mejora la correspondencia entre texto y vídeo. Está disponible en variantes de 2B (Apache 2.0) y 5B (licencia de investigación), con integración nativa en Diffusers.

Los clips duran entre 6 y 10 segundos a 720x480. Son cortos, pero la relación entre calidad y capacidad de cómputo es buena, y funciona en una GPU de 12GB.

EspecificaciónValor
Parámetros2B, 5B
I2VSí (CogVideoXImageToVideoPipeline)
Resolución720x480 a 8fps
LicenciaApache 2.0 (2B), investigación (5B)
Hardware12GB de VRAM

Primer fotograma frente a referencia real: la distinción clave ​

No toda la compatibilidad con «imágenes de referencia» es igual. Entender la diferencia es fundamental para elegir el modelo adecuado.

Los modelos de primer fotograma (LongCat, Helios, Hailuo, Luma Ray2, HunyuanVideo) tratan tu imagen como el fotograma inicial literal. El modelo genera la animación hacia delante partiendo exactamente de esa imagen. No puedes subir un retrato de un personaje y describirlo en una escena diferente. La imagen es la escena.

Los modelos de referencia real (Kling, Grok Imagine, Seedance, Vidu Q3, MiniMax H3, SkyReels V3) extraen la identidad de tu imagen y colocan ese personaje u objeto en cualquier escena que describas. Sube una foto de una persona y usa el prompt «esa persona camina por un bosque al atardecer». El personaje aparece en un entorno completamente nuevo mientras mantiene su identidad. Esto es lo que necesitas para contenido narrativo con varias escenas, como una película de aventuras.

Los modelos con ID de personaje (Sora 2 Pro) extraen la identidad de clips de vídeo, en lugar de imágenes estáticas. Creas una vez un ID de personaje persistente y lo reutilizas en un número ilimitado de generaciones futuras.

Los modelos de estilo/ingredientes (Veo 3.1) utilizan imágenes de referencia para influir en el estilo visual, las texturas y el aspecto general, en lugar de extraer identidades específicas de personajes. Son buenos para mantener la coherencia visual en todo un proyecto, pero menos precisos para controlar personajes individuales.

El flujo de trabajo real para vídeos de 10 minutos ​

Esta es la valoración sincera de la situación a mediados de 2026. Ningún modelo genera de forma fiable 10 minutos de vídeo coherente y de alta calidad en una sola toma. LongCat Video es el que más se acerca, con duraciones anunciadas de 15 minutos, pero la calidad y la coherencia varían de manera considerable con esas duraciones. Helios y SkyReels V2 generan vídeo «a escala de minutos» y de «duración infinita», respectivamente, pero los resultados requieren prompts cuidadosamente elaborados y, a menudo, varios intentos.

El flujo de trabajo que realmente funciona para la mayoría de los creadores que producen vídeos de entre 5 y 15 minutos combina varios enfoques:

Para contenido de busto parlante o con avatares: El modo de 2026 de LongCat Video basado en audio o la generación de avatares de SkyReels V3 pueden producir más de 5 minutos de un personaje parlante coherente. Es lo más parecido a «pulsar un botón y obtener un vídeo largo».

Para contenido narrativo con varias escenas (al estilo de una película de aventuras): Usa Kling 3.0, Grok Imagine o Seedance 2.0 con imágenes de referencia reales de los personajes. Genera tomas individuales de entre 10 y 15 segundos. Utiliza las mismas referencias @Element o <IMAGE> en cada generación para mantener la identidad de los personajes. Encadena las tomas mediante el modo multiptoma (Kling admite 6 tomas por llamada) o la API de extensión. Kling es la opción más probada para este flujo de trabajo. La separación explícita de Grok Imagine entre el «modo de referencia» y el «modo de primer fotograma» lo convierte en una alternativa sólida. Seedance 2.5 acepta ahora la mayor cantidad de entradas de referencia (50 archivos) y genera tomas de 30 segundos, lo que reduce aproximadamente a la mitad el número de empalmes; Vidu Q3 (7 referencias con etiquetas @) y MiniMax H3 (12 archivos) son opciones nuevas y creíbles.

Para mantener la coherencia de los personajes entre muchos clips: El sistema persistente character_id de Sora 2 Pro es el enfoque más limpio para proyectos muy largos. Extrae una vez el personaje de un vídeo corto y genera después decenas de clips que hagan referencia a ese ID. La identidad del personaje no se degrada con el tiempo porque se almacena como un embedding persistente, en lugar de volver a interpretarse a partir de una imagen en cada ocasión.

Para contenido con transferencia de estilo: Lucy Restyle en fal.ai procesa vídeos existentes de hasta 30 minutos y aplica transformaciones de estilo mediante IA mientras conserva el movimiento. Si tienes material de origen, esto evita por completo el problema de la duración de la generación. $0.01 por segundo de vídeo de origen.

Para pipelines de código abierto: Trabaja sobre Wan 2.2 o Helios con un bucle de continuación de vídeo, o sobre el punto de control Ref2VA de MiniMax H3 si su licencia comunitaria es válida en tu región, ya que es el primer modelo abierto con un modo de referencia de 9 imágenes. Genera un clip, utiliza el último fotograma como fotograma inicial del siguiente clip y repite el proceso. Los flujos de trabajo de ComfyUI automatizan esta tarea. La coherencia se degrada después de muchas iteraciones, pero es gratuito y controlable.

El desafío principal sigue siendo el mismo: incluso con compatibilidad real con imágenes de referencia, la desviación del personaje se acumula a lo largo de decenas de clips. Los rasgos faciales, el cabello, la ropa y el tono de piel cambian gradualmente. Las soluciones provisionales —fotos de referencia de alta calidad, prompts coherentes y generación de tomas por lotes— son necesarias. Pero modelos como Kling y Grok Imagine, que separan la identidad del personaje de la composición de la escena, hacen que esto sea muchísimo más fácil que con los modelos limitados al primer fotograma.

El enfoque del andamiaje 3D: renderiza con baja calidad, transforma con alta calidad ​

Hay un flujo de trabajo que está ganando terreno y que evita por completo la mayoría de los problemas de la generación de larga duración. En lugar de pedir a un modelo de IA que genere desde cero 10 minutos de vídeo, renderizas una cinemática 3D de baja fidelidad con el trabajo de cámara, el bloqueo de personajes y los tiempos correctos, y después la pasas por un modelo de vídeo a vídeo con imágenes de referencia y un prompt de mejora. El motor 3D se encarga de la estructura. La IA se encarga de la estética. Esto funciona porque la transformación V2V es un problema más acotado que la generación completa. El modelo no necesita inventar el movimiento de cámara, la ubicación de los personajes ni la composición de la escena. Solo tiene que dar un aspecto fotorrealista al metraje existente siguiendo tus referencias visuales. Es un problema mucho más abordable y permite trabajar con cualquier duración que tu motor 3D pueda renderizar.

Por qué funciona ​

Tu motor 3D te proporciona todo aquello con lo que los modelos de vídeo con IA todavía tienen dificultades: control preciso de la cámara, ubicación exacta de los personajes en el encuadre, interacciones físicas correctas y tiempos coherentes durante varios minutos de metraje. Zooms de vértigo, travellings, personajes que entran y salen del encuadre en el momento indicado: todo es trivial en un motor 3D y poco fiable en la generación mediante prompts de texto. La única tarea del modelo V2V es transformar los materiales, la iluminación y las texturas en un resultado fotorrealista, conservando la geometría y el movimiento que ya has definido.

También resulta más fácil mantener la consistencia de los personajes. En lugar de luchar contra la deriva de identidad en 50 generaciones de IA independientes, le muestras al modelo el mismo personaje 3D en cada fotograma. Las imágenes de referencia indican al modelo qué aspecto debe tener ese personaje en el resultado final. Es un problema más sencillo que generar desde cero un personaje consistente cada vez.

Además, la duración deja de ser una limitación. Lucy Restyle procesa 30 minutos en una sola llamada. Wan 2.1 en ComfyUI puede procesar cualquier duración por fragmentos. No tienes que enfrentarte al problema de «cómo genero 10 minutos» porque el metraje ya existe.

RealMaster (Meta / Universidad de Tel Aviv) ​

RealMaster es un sistema de investigación creado específicamente para este flujo de trabajo. Publicado en marzo de 2026 por Meta Reality Labs y la Universidad de Tel Aviv, transforma vídeo 3D renderizado en vídeo fotorrealista, manteniendo una alineación geométrica completa con la fuente.

El método extrae mapas de bordes del renderizado 3D para conservar la estructura y el movimiento y, después, aplica un modelo de difusión de vídeo —basado en la arquitectura VACE/Wan— para transformar todo lo demás en un resultado fotorrealista. Un adaptador IC-LoRA ligero condensa el proceso en una única pasada de inferencia que no necesita fotogramas de anclaje y puede gestionar objetos que aparecen a mitad de la secuencia.

Probado con secuencias de los simuladores GTA-V y CARLA, RealMaster supera ampliamente a las alternativas de edición de vídeo de propósito general. También puede añadir efectos meteorológicos mediante el prompt de texto («Haz que llueva», «Haz que nieve») además de aplicar la transformación fotorrealista. El modelo se generaliza entre distintos simuladores sin necesidad de reentrenamiento. Los pesos entrenados con datos de GTA-V funcionan con la salida de CARLA sin ningún ajuste adicional.

Disponibilidad: Solo para investigación. Aún no hay pesos públicos ni API.

EspecificaciónValor
EntradaVídeo 3D renderizado (cualquier motor)
SalidaVídeo fotorrealista que conserva la geometría y el movimiento
ArquitecturaIC-LoRA sobre una base de difusión de vídeo VACE/Wan
CondicionamientoMapas de bordes del renderizado de origen
Probado conSimuladores GTA-V y CARLA
LicenciaNo publicado (solo artículo de investigación)

Herramientas V2V de producción disponibles actualmente ​

Kling 3.0 V2V con referencias de elementos es la opción de producción más completa. Los endpoints Edit Video y Reference V2V de fal.ai aceptan clips de vídeo de origen de entre 3 y 10 segundos junto con referencias de elementos (@Element1, @Element2 con fotos frontales y desde varios ángulos) y un prompt de mejora. El modelo analiza las trayectorias de movimiento y los patrones de cámara de la fuente y, después, regenera el metraje con las apariencias de personajes y el estilo visual que hayas especificado, conservando la puesta en escena y el trabajo de cámara originales. Admite hasta 7 entradas de referencia. La salida es a 1080p. Procesa tu cinemática en fragmentos de 10-15 segundos usando las mismas referencias de elementos en todos ellos para mantener la consistencia de los personajes.

Lucy Restyle 2 procesa hasta 30 minutos de vídeo de origen en una sola llamada a la API por $0.01 por segundo de entrada. Acepta un prompt de texto y una imagen de referencia opcional como guía de estilo. No ofrece referencias de elementos para cada personaje como Kling, pero es la vía más sencilla y barata para transferir un estilo cinematográfico general a un renderizado 3D completo. Proporciónale el renderizado entero y un prompt que describa el aspecto deseado. La salida es a 720p, con consistencia temporal a lo largo de miles de fotogramas.

Wan 2.1 VACE en ComfyUI es la opción de código abierto. El modelo VACE 14B realiza V2V guiado por referencias: introduce un vídeo de origen junto con una imagen de referencia de estilo y obtén una versión rediseñada que conserva la estructura y el movimiento. El condicionamiento mediante mapas de bordes mejora la fidelidad estructural. Puedes crear un bucle de procesamiento que gestione cualquier duración por fragmentos con referencias de estilo consistentes. Es gratuito y se ejecuta localmente en tu propio hardware.

Grok Imagine V2V acepta vídeo de origen junto con entre 1 y 7 imágenes de referencia en el modo de referencia. Cuesta $0.05 por segundo a 720p. La separación explícita entre el modo de referencia y el modo de primer fotograma permite que tus referencias guíen la apariencia de los personajes sin sustituir la estructura del vídeo de origen.

Qué necesita tu renderizado 3D ​

El nivel mínimo de calidad del renderizado es importante. Una simple malla de alambre no proporcionará al modelo V2V suficiente información con la que trabajar. Sin embargo, tampoco necesitas materiales ni iluminación con calidad de producción.

Proporciones y geometría correctas. Los modelos de los personajes deben tener unas proporciones corporales y una estructura facial aproximadamente correctas para que las imágenes de referencia puedan trasladarse adecuadamente. Basta con una geometría humanoide básica con proporciones correctas. Una figura de palitos no producirá un personaje reconocible.

Dirección de iluminación básica. Una única luz direccional que establezca la iluminación general de la escena ayuda al modelo a comprender la atmósfera deseada. La IA mejorará y añadirá detalles, pero necesita saber si la escena transcurre a plena luz del día o en un interior oscuro.

Movimiento de cámara fluido. Los movimientos de cámara estables y deliberados se trasladan bien. Los movimientos erráticos o extremadamente rápidos pueden confundir a los modelos V2V. Haz que tu cámara virtual se comporte como lo haría una cámara real.

Sombreado plano en lugar de malla de alambre. La geometría sencilla con sombreado plano o pocos polígonos ofrece mejores resultados que las mallas de alambre o los modelos sin texturas. Incluso unos colores sólidos básicos sobre las superficies ayudan al modelo a comprender los límites entre materiales.

Coste y escala ​

Procesamiento de una cinemática de 10 minutos con distintas herramientas:

HerramientaDuración máxima de entradaCoste para 10 minResoluciónImágenes de referencia
Kling O3 V2VClips de 10 s~$50-671080pHasta 7 (elementos + estilo)
Lucy Restyle 230 minutos$6720p1 (solo estilo)
Grok Imagine V2VClips de 10 s~$30720p1-7
Wan 2.1 VACECualquiera (por fragmentos)Gratis (GPU local)720p1 por fragmento

Estas cifras son estimaciones nuestras basadas en los precios de catálogo de los proveedores cuando realizamos la comparación por primera vez a mediados de 2026. Los proveedores cambian sus precios con frecuencia, así que considéralas una clasificación relativa y no un presupuesto. Lucy Restyle es la opción más barata para procesar vídeos completos. Kling es la más precisa para mejorar personajes concretos mediante referencias de elementos. Wan 2.1 es gratis si dispones del hardware necesario (requiere unos 60 GB de VRAM para el modelo 14B a 720p o 8 GB para la variante 1.3B con menor calidad).

Tabla comparativa ​

ModeloDuración nativa máximaDuración ampliadaTipo de referenciaMáx. de refs.ResoluciónAPI disponibleCódigo abierto
LongCat Video~15 minN/DSolo primer fotograma1720p/30fpsSí (fal.ai)Sí (MIT)
Seaweed APT2~5 minN/DI2V + pose1720pNoNo
HeliosEscala de minutosN/DPrimer fotograma (I2V)1720pHF SpacesSí (Apache 2.0)
SkyReels V3IlimitadaN/DReferencia real1-4720pNoSí
Kling 3.015s~3 minElementos + refs. de estilo71080pSíNo
Grok Imagine15sEncadenableReferencia real7720pSíNo
Seedance 2.015sN/DRefs. multimodales122KSíNo
Seedance 2.530sExtensión en varias rondasRefs. multimodales502KSí (BytePlus, Runway)No
Vidu Q316sN/DReferencia real71080pSíNo
MiniMax H315sN/DRefs. multimodales122KSíSí (licencia comunitaria)
Runway Gen-4.510s~1 minI2V (0-1)11080pSíNo
Veo 3.18s~2.5 minIngredientes (estilo)34KSíNo
Gemini Omni Flash10sEdiciones conversacionales + extensión (1.1)Refs. multimodalesImágenes + vídeo720pSí (GA)No
Sora 2 Pro ⚠️ en retirada20sEncadenableID de personaje (vídeo)21080pLa API se retira en sep. de 2026No
Hailuo 0210sN/DI2V (primer fotograma)11080pSíNo
Luma Ray3.220sN/DFotogramas clave + ref. de personaje16 fotogramas clave1080p (reescalado a 4K)SíNo
Pika 2.510s25sPikascenes101080pSíNo
Wan 2.1 / 2.2Clips cortosMediante continuaciónI2V / FLF2V1-2720pMediante fal.aiSí (Apache 2.0)
Wan 3.030sN/DRefs. multimodalesImágenes, vídeo, audio1080pSí (Alibaba Cloud)No
HunyuanVideoClips cortosMediante continuaciónI2V (primer fotograma)1720pMediante fal.aiSí
LTX-2.320sMediante continuaciónI2V + fotogramas claveVarios fotogramas clave4KSí (LTX, fal.ai)Pesos (con límites ARR)
CogVideoX6-10sMediante continuaciónI2V (primer fotograma)1720x480Mediante fal.aiSí

Lo que está por venir ​

La trayectoria a lo largo de 2026 está clara. LongCat Video demostró que la generación de varios minutos con consistencia es posible en un modelo abierto. Helios demostró que puede hacerse en tiempo real. Seaweed APT2 mostró la generación interactiva de larga duración. Y los modelos con referencias reales (Kling, Grok, Seedance) demostraron que la identidad de los personajes puede persistir en escenas arbitrarias.

El siguiente paso consiste en combinar estas capacidades: generación nativa de larga duración con compatibilidad real con referencias de personajes. Ahora mismo tienes que elegir una u otra. Cuando un modelo pueda generar 5 minutos de vídeo manteniendo los personajes de las imágenes de referencia durante decenas de cambios de escena, el flujo de trabajo de clips encadenados quedará obsoleto. Seedance 2.5 (clips nativos de 30 segundos, hasta 50 archivos de referencia, publicado el 31 de julio de 2026) y Wan 3.0 (tomas únicas de 30 segundos a partir de referencias multimodales, agosto de 2026) son los primeros pasos reales en esa dirección.

A principios de septiembre de 2026, la clasificación de texto a vídeo de Artificial Analysis (con audio) sitúa a Gemini Omni Flash de Google y al modelo Wan 3.0 de Alibaba, disponible solo mediante API, empatados en primera posición (~1,239 Elo), con MiniMax H3 Max y H3 unos puntos por detrás, seguidos de Seedance 2.0, Wan 2.7, los modelos HappyHorse, la versión preliminar de MAGI-2 de Sand.ai y Kling 3.0 Pro, que completan los diez primeros puestos. La clasificación cambia con frecuencia, así que considera cualquier posición concreta como una instantánea y no como un orden fijo.

El enfoque basado en una estructura 3D ofrece una trayectoria paralela. A medida que los modelos V2V mejoran su conservación estructural y su fotorrealismo, la mejora de renderizados 3D de baja fidelidad resulta cada vez más viable para producciones completas. RealMaster de Meta ya consigue una transformación de simulación a realidad con calidad de investigación a partir de la salida de motores de videojuegos. Cuando esta capacidad llegue a las API de producción con compatibilidad para imágenes de referencia, cualquier persona con conocimientos básicos de 3D podrá producir vídeo fotorrealista de larga duración con un control absoluto de la cámara, la puesta en escena y la ubicación de los personajes, sin importar la duración.

Por ahora, la respuesta práctica depende de tu caso de uso:

Mejor para referencias de varios personajes: Kling 3.0 (hasta 7 refs. con sistemas separados de elementos y estilo), Seedance 2.5 (hasta 50 entradas multimodales en una toma de 30 segundos) o Vidu Q3 (7 referencias etiquetadas con cambios de cámara dentro del clip).

Mejor API para generar vídeo a partir de referencias: Grok Imagine (API sencilla, modo de referencia explícito, $0.05/s para el modelo original), Vidu Q3 (etiquetas @, 7 refs.) o Kling mediante fal.ai.

Mejor para personajes persistentes en muchos clips: Las referencias de elementos de Kling 3.0 o el sistema de referencia y extensión de SkyReels V3. (El sistema de ID de personajes de Sora 2 Pro era el enfoque más limpio, pero se retirará en 2026, así que no inicies proyectos nuevos con él).

Mejor opción de código abierto: SkyReels V3 (1-4 imágenes de referencia reales, duración ilimitada), MiniMax H3 (9 imágenes de referencia más vídeo y audio, licencia comunitaria con solicitud regional) o Helios (tiempo real, Apache 2.0).

Mejor para duración bruta: LongCat Video (~15 min, pero solo con primer fotograma).

Mejor para mejorar renderizados 3D: Kling 3.0 V2V (refs. de elementos por personaje, 1080p) o Lucy Restyle 2 (entrada de 30 min, $0.01/s).


Preguntas frecuentes ​

¿Cuál es el mejor modelo de vídeo con IA para vídeos largos? ​

Para duración bruta, LongCat Video genera de forma nativa unos 15 minutos, aunque solo usa el primer fotograma. Para vídeos largos con personajes consistentes, la respuesta práctica en 2026 es un flujo de trabajo de referencia y extensión: genera clips con un modelo que ofrezca buena compatibilidad con referencias (Kling 3.0, Runway Gen-4.5 o SkyReels V3 de código abierto) y después encadénalos. Ningún modelo ofrece a la vez una gran duración y una identidad de personaje perfecta, por lo que la mayoría de los trabajos de producción combinan varios.

¿Qué modelos de vídeo con IA admiten imágenes de referencia? ​

Kling 3.0 Omni, Runway Gen-4.5, Seedance 2.0 y 2.5, Vidu Q3, MiniMax H3, Google Veo 3.1 y Gemini Omni Flash admiten imágenes de referencia entre las opciones comerciales. En cuanto al código abierto, SkyReels V2/V3, Wan 2.1 y 2.2, LTX-2.5 y los pesos abiertos de MiniMax H3 aceptan entradas de referencia que puedes ejecutar por tu cuenta. La calidad de esta función varía mucho, por eso la guía anterior los divide en niveles.

¿Puede la IA generar un personaje consistente a lo largo de un vídeo extenso? ​

Sí, pero no en una sola generación. El método fiable consiste en fijar un personaje con una o varias imágenes de referencia, generar clips cortos y ampliarlos o unirlos mientras vuelves a proporcionar las mismas referencias. La compatibilidad con referencias reales —que permite al modelo conservar la identidad entre nuevas generaciones— es mucho más importante en este caso que el condicionamiento mediante el primer fotograma, que solo establece el fotograma inicial.

¿Cuál es la diferencia entre el primer fotograma y la compatibilidad real con imágenes de referencia? ​

El condicionamiento por primer fotograma usa tu imagen como el fotograma inicial literal del clip y luego se desvía a medida que avanza el vídeo. La compatibilidad real con referencias trata la imagen como un ancla de identidad que el modelo respeta durante toda la generación, de modo que un personaje o estilo mantiene la coherencia a lo largo del clip y entre clips distintos. La sección anterior detalla qué hace cada modelo.

¿Cómo funciona la conversión de imagen a vídeo de Kling AI con varias imágenes de referencia? ​

La referencia de varias imágenes de Kling es un modo independiente de la conversión de imagen a vídeo convencional. En lugar de animar una sola imagen como primer fotograma, puedes subir hasta 7 imágenes y elementos (4 si también adjuntas un vídeo de referencia), etiquetarlos en el prompt como @Image1 o @Element1 y describir la toma. Los elementos son personajes u objetos fijados, creados a partir de hasta 4 fotos desde distintos ángulos o un breve clip de vídeo, opcionalmente con una voz vinculada, y se mantienen en todo el guion gráfico de múltiples tomas de Kling. Las reglas completas aparecen en la sección sobre Kling anterior, tomadas directamente de la guía de Kuaishou.

¿Y Wan 2.2? ¿Wan 2.5 o Wan 3.0 son de código abierto? ​

Wan 2.2 (julio de 2025) es la versión más reciente de Wan que puedes descargar: una versión Mixture-of-Experts con licencia Apache 2.0, una variante de 5B que funciona en una sola RTX 4090 y modelos de 14B de texto a vídeo e imagen a vídeo. Wan 2.5, 2.6, 2.7 y Wan 3.0 (agosto de 2026, tomas únicas de 30 segundos con una resolución de hasta 1080p) solo están disponibles mediante API a través de Alibaba Cloud y no ofrecen pesos públicos, digan lo que digan los blogs de afiliados. Si buscas un flujo de trabajo con imágenes de referencia y pesos abiertos, usa los modelos de imagen a vídeo y de primer y último fotograma de Wan 2.2, o consulta SkyReels V3 y MiniMax H3.

¿Cuál es la diferencia entre imagen a vídeo y referencia a vídeo? ​

La conversión de imagen a vídeo anima la imagen que proporcionas: tu imagen es el fotograma inicial y el modelo continúa a partir de ella. La conversión de referencia a vídeo utiliza tus imágenes como anclas de identidad y estilo y genera una toma nueva a partir de tu prompt, de modo que un personaje fotografiado en un estudio puede aparecer caminando por un bosque. La conversión de imagen a vídeo es adecuada para animar una imagen fija terminada. La conversión de referencia a vídeo es adecuada para historias con varias escenas y un personaje coherente. Kling, Vidu Q3, Seedance, Grok Imagine y MiniMax H3 ofrecen ambos modos, y Vidu y Grok los identifican explícitamente en sus API.

¿Qué modelos de vídeo con IA mantienen el mismo sujeto entre distintos clips (referencia de sujeto)? ​

Para mantener la referencia de un sujeto o personaje a lo largo de muchos clips, las opciones más potentes a septiembre de 2026 son Kling 3.0 Omni (biblioteca de elementos con fotos desde varios ángulos y voz), Seedance 2.5 (hasta 50 referencias y tomas de 30 segundos), Vidu Q3 (7 sujetos etiquetados) y MiniMax H3 (9 imágenes de referencia, además de vídeo y audio). Luma Ray3 incorpora una función de referencia de personajes y los identificadores de personajes de Sora 2 Pro ofrecían el sistema más depurado, pero la API de Sora dejará de funcionar el 24 de septiembre de 2026. Entre los modelos con pesos abiertos, SkyReels V3 y MiniMax H3 son los que ofrecen una verdadera referencia de sujeto.


Contenido relacionado ​

Pruébalo ahora mismoHaz que la escena sea jugable en lugar de prerenderizada

Olvídate de la cola de renderizado y recórrela en directo.

Créalo gratis →Es gratis, funciona en tu navegador, nada que instalar.