Skip to content

Mejores modelos de vídeo con IA compatibles con imágenes de referencia (2026)

Última actualización: julio de 2026.

Generar un clip de 10 segundos ahora es fácil. Todos los modelos principales pueden hacerlo. La verdadera pregunta es: ¿puedes generar 5 o 10 minutos de vídeo coherente en los que un personaje mantenga el mismo aspecto en el primer minuto y en el octavo? ¿Y en los que la escena conserve su coherencia a lo largo de cientos de fotogramas?

Ese es el problema difícil. Y es donde todo está cambiando rápidamente. Esta guía abarca todos los modelos que hemos encontrado que generan vídeo largo de forma nativa o admiten los flujos de trabajo necesarios para crear contenido de larga duración con personajes coherentes mediante imágenes de referencia. Los dividimos en tres niveles: modelos que generan directamente vídeos de varios minutos, modelos con una sólida compatibilidad con imágenes de referencia que puedes ampliar mediante continuaciones y opciones de código abierto que puedes ejecutar por tu cuenta.

Nivel 1: generación nativa de larga duración (varios minutos o más)

Estos modelos generan vídeos cuya duración se mide en minutos, no en segundos. Están diseñados desde cero para mantener la coherencia temporal en secuencias largas.

LongCat Video

Meituan lanzó LongCat Video a finales de 2025. Es un transformer de difusión con 13.600 millones de parámetros y el primer modelo capaz de generar de forma fiable vídeos coherentes de hasta 15 minutos.

El modelo admite texto a vídeo, imagen a vídeo y continuación de vídeo dentro de una canalización unificada. En el modo I2V, la imagen de entrada se convierte literalmente en el primer fotograma del vídeo. No es una referencia flexible de un personaje que puedas colocar en cualquier escena. El modelo anima hacia delante a partir de ese fotograma inicial y utiliza «Cross-Chunk Latent Stitching» para seguir tomando como referencia la imagen original durante toda la generación, lo que evita las desviaciones de color y mantiene la coherencia visual en secuencias largas. Una variante actualizada de 2026 añade la generación de avatares controlada por audio con sincronización labial para vídeos de bustos parlantes de más de 5 minutos.

Internamente, LongCat utiliza un enfoque de generación de lo general a lo detallado con Block Sparse Attention para manejar las enormes longitudes de las secuencias. El ajuste mediante RLHF mejora la calidad del movimiento. En la prueba VBench 2.0 ocupa el tercer puesto general, por detrás de Google Veo 3 y Vidu Q1 de Shengshu.

Disponibilidad: Código abierto con licencia MIT. Disponible a través de la API de fal.ai por 0,04 $ por segundo generado (36 $ por un vídeo de 15 minutos a 720p). También está disponible mediante la propia plataforma de LongCat, con precios basados en créditos.

EspecificaciónValor
Duración máxima~15 minutos
Resolución720p a 30fps
Parámetros13.6B
Imágenes de referenciaSolo primer fotograma (modo I2V, no referencia de personaje)
LicenciaMIT
Coste de la API~$0.04/segundo (fal.ai)

Seaweed APT2

Seaweed APT2 de ByteDance adopta un enfoque diferente. En lugar de generar por adelantado un vídeo completo, produce fotogramas de forma autorregresiva a 24fps, con una latencia de solo 0,16 segundos por fotograma en una única H100. El resultado es un vídeo estable de hasta 5 minutos que mantiene la coherencia temporal.

El truco técnico es Autoregressive Adversarial Post-Training (AAPT), que convierte un modelo de difusión de vídeo bidireccional preentrenado en un generador autorregresivo unidireccional. Una sola evaluación de propagación hacia delante de la red por fotograma. Eso es lo que permite generar en tiempo real.

Lo que hace interesante a este modelo, más allá de su duración, es la interactividad. Puedes controlar la cámara, animar personajes mediante detección de poses y manipular las escenas mientras se renderiza el vídeo. No lo veas tanto como «generar un vídeo», sino como «dirigir un vídeo en tiempo real».

Disponibilidad: Solo en fase de investigación. Aún no está disponible públicamente. El modelo base 7B (Seaweed-7B) cuenta con un artículo publicado, pero los pesos de APT2 no se han publicado.

EspecificaciónValor
Duración máxima~5 minutos
Resolución736x416 (una GPU), hasta 720p (8 GPU)
Parámetros8B
Imágenes de referenciaMediante I2V y control interactivo de poses
LicenciaNo publicado
EstadoVista previa de investigación

Helios

Helios procede de la Universidad de Pekín y está construido sobre Wan 2.1. Es un modelo de 14B parámetros que genera vídeo a escala de minutos a 19,5 FPS en una única H100. La innovación principal está en cómo aborda las desviaciones en vídeos largos. En lugar de utilizar técnicas convencionales para evitarlas, como la autoimposición o el muestreo de fotogramas clave, Helios simula las desviaciones durante el entrenamiento para que el modelo aprenda a corregirlas.

Admite de forma nativa tareas de texto a vídeo, imagen a vídeo y vídeo a vídeo. El modo I2V acepta imágenes de referencia para iniciar la generación.

Disponibilidad: Totalmente de código abierto con licencia Apache 2.0. Publicado en marzo de 2026. Código y pesos en GitHub (PKU-YuanGroup/Helios). Integrado en Diffusers, SGLang y vLLM-Omni. Demo de Gradio en HuggingFace Spaces.

EspecificaciónValor
Duración máximaA escala de minutos (sin límite fijo)
Resolución720p
Parámetros14B
Imágenes de referenciaSí (modo I2V)
LicenciaApache 2.0
HardwareUna única H100 para tiempo real

SkyReels V2 / V3

SkyReels V3 acepta entre 1 y 4 imágenes de referencia y genera vídeos de duración ilimitada con cambios entre múltiples planos y síntesis de avatares guiada por audio.

La línea SkyReels de Skywork aspira a crear vídeos de duración infinita. V2 utiliza una arquitectura AutoRegressive Diffusion-Forcing que genera vídeo sin un límite fijo de duración. V3, publicado en enero de 2026, unifica en un solo modelo la generación de vídeo a partir de imágenes de referencia, la extensión de vídeo a vídeo y la generación de avatares guiada por audio.

V3 acepta entre 1 y 4 imágenes de referencia y conserva la identidad del sujeto a lo largo del vídeo generado. El modo de vídeo a vídeo permite continuaciones fluidas de un solo plano y cambios entre múltiples planos con transiciones cinematográficas.

Skywork lanzó SkyReels V4 el 25 de febrero de 2026, el primer modelo de código abierto que genera vídeo y audio conjuntamente en una única pasada de doble flujo, con una resolución de hasta 1080p/32fps. Acepta texto, imágenes, clips de vídeo, máscaras y audio como entradas de condicionamiento, y unifica la generación, el relleno y la edición en un solo entorno, ampliando el enfoque de referencia y extensión de V2/V3 con sonido nativo. Ahora se sitúa cerca de los primeros puestos de la clasificación de texto a vídeo de Artificial Analysis.

Disponibilidad: Totalmente de código abierto. Modelos de entre 1.3B y 14B parámetros. Disponibles a 540p y 720p. Código y pesos en GitHub y HuggingFace.

EspecificaciónValor
Duración máximaIlimitada (autorregresiva)
Resolución540p, 720p
Parámetros1.3B, 5B, 14B
Imágenes de referencia1-4 imágenes (V3)
LicenciaCódigo abierto
HardwareRTX 4090 como mínimo, se recomiendan 4-8x A100

Nivel 2: clips cortos con referencias sólidas y extensión

Estos modelos generan clips de entre 8 y 60 segundos, pero ofrecen una sólida compatibilidad con imágenes de referencia y funciones de extensión de vídeo. Para crear contenido de larga duración, encadenas clips mediante los endpoints de continuación o extensión del modelo. La coherencia de los personajes procede de imágenes de referencia que persisten entre generaciones.

Este es el flujo de trabajo práctico que la mayoría de los creadores utiliza actualmente para contenido de más de un minuto. La calidad de cada clip suele ser superior a la de los modelos nativos de larga duración.

Kling 3.0 Omni (Kuaishou)

Kling 3.0 Omni combina elementos de personajes, referencias de estilo y guiones gráficos con múltiples planos en una única llamada, con salida nativa en 4K a 60fps.

Kling tiene el sistema de imágenes de referencia más completo de todos los modelos de vídeo. Separa las entradas de referencia en tres categorías distintas, cada una con una finalidad diferente:

Imágenes de referencia (image_urls): Hasta 4 imágenes para orientar el estilo y la apariencia. Las etiquetas en el prompt como @Image1, @Image2, etc. Influyen en el aspecto general, el estilo de la escena y el entorno sin convertirse en el primer fotograma.

Elementos (elements): Entradas específicas para personajes u objetos. Cada elemento recibe una frontal_image_url (una foto frontal nítida) y varias reference_image_urls opcionales (ángulos adicionales). Haces referencia a ellos como @Element1, @Element2 en el prompt. El modelo extrae la identidad del personaje y lo coloca en cualquier escena que describas. Esta es la función clave para crear contenido al estilo de una película de aventuras: sube la foto de un personaje y, a continuación, describe cómo camina por un bosque, lucha contra un dragón o hace cualquier otra cosa que quieras.

Fotogramas inicial y final (start_image_url, end_image_url): Fijan imágenes concretas como primer o último fotograma. Son fotogramas literales, no guías de estilo.

El total entre las tres categorías es de hasta 7 entradas de referencia (se reduce a 4 cuando también se utiliza un vídeo de referencia). Un único prompt como "@Element1 y @Element2 están cenando en esta mesa de @Image1" puede combinar personajes con referencias de escenas.

Para contenido de larga duración, Kling ofrece dos vías. El modo de múltiples planos genera hasta 6 escenas en una única llamada, cada una con su propio prompt y duración (entre 3 y 15s). Los elementos de los personajes persisten automáticamente en todos los planos. La API de extensión continúa desde el punto donde terminó un vídeo completado y permite alcanzar aproximadamente 3 minutos mediante extensiones encadenadas. El modo de edición V2V toma un vídeo existente (de entre 3 y 10 segundos) y lo transforma mediante referencias de elementos y un prompt de texto, conservando el movimiento de la cámara y la puesta en escena de los personajes del vídeo original, a la vez que modifica el estilo de personajes y entornos según tus referencias. Esto hace que Kling resulte especialmente útil para mejorar grabaciones existentes, incluidos renders 3D de baja fidelidad.

Kling 3.0 Omni unifica texto a vídeo, imagen a vídeo, referencia a vídeo y edición de vídeo en un solo modelo con generación nativa de audio y sincronización labial. El 17 de junio de 2026, Kuaishou añadió Kling 3.0 Turbo, una variante más rápida y económica con audio incluido a 720p y 1080p (precio de catálogo aproximado de 0,11-0,14 $/s), y mejoró la canalización de edición de Omni para aceptar y producir vídeos en 4K.

Disponibilidad: API comercial a través de Kuaishou, fal.ai (0,084-0,112 $/s) y Replicate. Interfaz web en klingai.com.

EspecificaciónValor
Duración nativa del clip3-15 segundos
Duración extendida~3 minutos (mediante extensiones encadenadas)
Resolución720p, 1080p (4K en la edición de Omni)
Imágenes de referenciaHasta 4 (referencias de estilo @Image)
ElementosHasta 4 (referencias de personajes @Element con imagen frontal y ángulos)
Referencias totalesHasta 7 combinadas (4 con referencia de vídeo)
Múltiples planosSí (hasta 6 planos en el guion gráfico)
AudioAudio sincronizado nativo + sincronización labial
Edición de vídeoSí (edición de vídeos existentes guiada por texto)
APIKuaishou, fal.ai, Replicate

Grok Imagine (xAI)

Grok Imagine separa el modo de referencia del modo de primer fotograma, lo que te permite etiquetar hasta 7 imágenes como referencias de personajes u objetos en el prompt.

xAI lanzó el modo Reference-to-Video de Grok Imagine a principios de 2026, con compatibilidad para entre 1 y 7 imágenes de referencia. La documentación lo distingue explícitamente de la generación de imagen a vídeo: «A diferencia de la generación de imagen a vídeo, donde la imagen de origen se convierte en el fotograma inicial, las imágenes de referencia influyen en lo que aparece en el vídeo sin fijar el primer fotograma».

Etiquetas las imágenes en el prompt como <IMAGE_1>, <IMAGE_2>, etc. Un prompt como "la modelo de <IMAGE_1> entra en la pasarela con la camiseta de <IMAGE_2>" combina la referencia de una persona con la de una prenda. El modelo permite realizar pruebas virtuales de ropa, colocar productos y contar historias con personajes coherentes entre escenas.

Una limitación: no puedes combinar imágenes de referencia con imagen a vídeo en la misma solicitud. Debes elegir entre el modo de primer fotograma y el modo de referencia; no puedes utilizar ambos.

Grok Imagine también dispone de un endpoint de extensión de vídeo que añade nuevas secuencias al final de un vídeo existente. El parámetro duration controla únicamente la parte nueva. Puedes encadenar extensiones para crear contenido más largo.

xAI publicó Grok Imagine 1.5 como vista previa de la API el 3 de junio de 2026 y después lo puso a disposición general como grok-imagine-video-1.5 el 16 de junio, mientras una variante Fast comenzaba a llegar a las aplicaciones para consumidores. Es un modelo de imagen a vídeo que anima una única imagen estática para producir movimiento cinematográfico con desplazamientos de cámara, atmósfera, física y audio sincronizado generado de forma nativa en la misma pasada de inferencia. Admite secuencias de múltiples planos para encadenar escenas coherentes, genera un clip de 6 segundos a 720p en unos 25 segundos y actualmente ocupa el tercer puesto en la clasificación de imagen a vídeo de Artificial Analysis. El precio es de 0,08 $/s a 480p y 0,14 $/s a 720p, más 0,01 $ por imagen de entrada.

Disponibilidad: API de xAI (lanzada en enero de 2026), fal.ai y Replicate. SDK de Python, JavaScript/AI SDK y API REST. 0,05 $/s a 720p con audio. También disponible para suscriptores de X Premium.

EspecificaciónValor
Duración nativa del clip1-15 segundos
Duración ampliadaSe pueden encadenar clips mediante la API de extensión
Resolución480p, 720p
Imágenes de referencia1-7 (referencias reales, no fotogramas iniciales)
Etiquetas del prompt<IMAGE_1>, <IMAGE_2>, etc.
AudioSí (720p)
Edición de vídeoSí (guiada por texto)
APIAPI de xAI, fal.ai, Replicate
Coste de la API0,05 $/segundo (720p con audio)

Seedance 2.0 (ByteDance)

Seedance 2.0 admite hasta 12 entradas multimodales simultáneas y genera vídeo con sincronización de audio nativa y sincronización labial a nivel de fonemas en más de 8 idiomas.

Seedance 2.0 de ByteDance es el modelo que admite más entradas de referencia: hasta 12 archivos simultáneos, entre ellos un máximo de 9 imágenes, 3 vídeos y 3 archivos de audio. El modelo permite generar audio y vídeo de forma nativa, con sincronización labial a nivel de fonemas en más de 8 idiomas.

Cada imagen puede ocupar hasta 30 MB. Los vídeos de referencia deben durar entre 2 y 15 segundos. El modelo utiliza las referencias para definir el aspecto de los personajes, el estilo de la escena y el movimiento.

El próximo gran salto ya está programado. ByteDance anunció Seedance 2.5 en su conferencia FORCE de Volcano Engine el 23 de junio de 2026: un único clip nativo de 30 segundos generado en una sola pasada y hasta 50 archivos de referencia multimodales, frente a los 12 actuales. Se desplegará primero mediante Dreamina y Jimeng, y la API se abrirá en BytePlus el 16 de julio de 2026. Si se publica tal como se mostró en la demostración, eliminará gran parte del trabajo de unir clips que se describe en esta guía.

Disponibilidad: API oficial de ByteDance (mediante Volcengine, lanzada en febrero de 2026) y proveedores de API externos. Salida de 480p-720p mediante API y resolución cinematográfica de hasta 2K a través de la plataforma.

EspecificaciónValor
Duración nativa del clip4-15 segundos
ResoluciónHasta 2K (cinematográfica)
Imágenes de referenciaHasta 9 imágenes + 3 vídeos + 3 audios (12 en total)
AudioNativo con sincronización labial (más de 8 idiomas)
APIByteDance/Volcengine, proveedores externos

Runway Gen-4.5

Runway Gen-4.5 se estrenó en lo más alto de la clasificación de texto a vídeo de Artificial Analysis, con 1247 puntos ELO, por delante de Veo 3 y Sora 2 Pro en aquel momento. A mediados de 2026, la clasificación había cambiado (ahora lidera Gemini Omni Flash), pero Gen-4.5 sigue siendo un modelo de primer nivel por su calidad cinematográfica y el control de las acciones. El modelo genera clips de 2-10 segundos a partir de texto y permite crear vídeos largos de hasta un minuto con personajes coherentes mediante secuencias de varias tomas.

La generación de imagen a vídeo se añadió en enero de 2026 y admite imágenes de referencia para todas las relaciones de aspecto. El modelo integra campos de radiancia neuronal y Gaussian splatting dentro de la arquitectura de difusión, lo que le proporciona una comprensión geométrica 3D en lugar de limitarse a predecir píxeles. Esto se traduce en una mayor permanencia de los objetos y movimientos físicamente plausibles.

Disponibilidad: API comercial e interfaz web. SDK para Node y Python. También disponible en Replicate.

EspecificaciónValor
Duración nativa del clip2-10 segundos
Modo de vídeo largoHasta aproximadamente 1 minuto
ResoluciónHasta 1080p
Imágenes de referencia0-1 por generación
AudioGeneración de audio nativa
Varias tomas
APISí (Runway, Replicate)

Google Veo 3.1

Veo 3.1 de Google genera de forma nativa clips de 4, 6 u 8 segundos. La función «Extend Video» (actualmente en vista previa) encadena clips hasta alcanzar aproximadamente 1-2,5 minutos, aunque la coherencia puede degradarse en las secuencias más largas.

La función «Ingredients to Video» admite hasta 3 imágenes de referencia como entrada. Puedes proporcionar personajes para animar, fondos y texturas de materiales. Cuando utilizas imágenes de referencia, el modelo se mantiene más fiel a tus referencias visuales y realiza menos cambios aleatorios. Una limitación: el modo de imágenes de referencia solo funciona con la opción de 8 segundos.

Desde enero de 2026, Veo 3.1 permite generar vídeo vertical (9:16) a partir de referencias y escalar a 4K en Vertex AI.

Disponibilidad: API de Google Vertex AI, API de Gemini y Google Flow. Requiere una cuenta de Google Cloud.

EspecificaciónValor
Duración nativa del clip4, 6 u 8 segundos
Duración ampliadaAproximadamente 1-2,5 minutos
ResoluciónHasta 4K (con escalado)
Imágenes de referenciaHasta 3 («Ingredients to Video»)
AudioDiálogo y música sincronizados
APIVertex AI, API de Gemini

Google Gemini Omni Flash

Google anunció la familia Gemini Omni en I/O en mayo de 2026 y lanzó Gemini Omni Flash como su primer modelo. Rápidamente alcanzó el primer puesto en la clasificación de Artificial Analysis, por delante de Veo 3.1. Su propuesta es el vídeo conversacional: generas un clip de 10 segundos a partir de texto, imágenes o vídeo y luego lo editas mediante instrucciones sucesivas que se acumulan. Puedes cambiar la iluminación, sustituir un atuendo o ajustar la cámara, todo ello sin volver a generar el vídeo desde cero.

En cuanto a las referencias, Omni Flash admite imágenes y clips de vídeo cortos como referencias de estilo, movimiento y efectos; también está previsto admitir referencias de audio. La coherencia de los personajes se mantiene durante las ediciones conversacionales, aunque la propia documentación de Google señala que puede fallar al cambiar de escena y durante los barridos de cámara. Por tanto, revisa los resultados centrados en personajes antes de publicarlos.

Disponibilidad: La API (gemini-omni-flash-preview) se abrió en vista previa pública el 30 de junio de 2026 mediante Google AI Studio y la API de Gemini, con un coste aproximado de 0,10 $ por segundo de salida. Todos los clips incluyen una marca de agua SynthID. El acceso para consumidores se ofrece mediante la aplicación Gemini, Google Flow y YouTube Shorts.

EspecificaciónValor
Duración nativa del clip10 segundos (se prevén duraciones mayores)
Resolución720p
Entradas de referenciaImágenes + clips de vídeo cortos (audio previsto)
EdiciónConversacional e iterativa
AudioNativo
APIAPI de Gemini (vista previa pública), aproximadamente 0,10 $/s

OpenAI Sora 2 / Sora 2 Pro

Se retirará en 2026: OpenAI está desmantelando Sora. La aplicación de Sora para consumidores cerró el 26 de abril de 2026 y la API de Sora 2 dejará de estar disponible el 24 de septiembre de 2026, sin que se haya anunciado un sustituto. Las capacidades que se describen a continuación siguen siendo destacables, pero no crees un flujo de trabajo nuevo basado en Sora. Utiliza Kling, Grok Imagine o un modelo abierto.

Sora 2 Pro genera clips de hasta 20 segundos. La API de Characters utiliza un enfoque distinto al de Kling o Grok: en vez de subir imágenes estáticas, creas un character_id indicando a la API un clip de vídeo (con un intervalo de marcas de tiempo de 1-3 segundos). Sora analiza los fotogramas del vídeo para extraer la estructura facial, las proporciones corporales, el estilo de la ropa y otros rasgos identificativos. Ese character_id se conserva indefinidamente y puede reutilizarse en un número ilimitado de generaciones futuras.

Puedes hacer referencia a un máximo de 2 personajes subidos por generación. Desde marzo de 2026, las referencias de personajes también funcionan con objetos y animales, no solo con personas. La extensión de vídeo utiliza todo el clip inicial como contexto para la continuación.

El sistema de personajes requiere una entrada de vídeo, no imágenes estáticas, para crear los personajes. Si solo tienes fotos, primero tendrás que generar un vídeo corto y después extraer el personaje de él.

Disponibilidad: API de OpenAI compatible con la API de Batch para flujos de producción.

EspecificaciónValor
Duración nativa del clipHasta 20 segundos
ResoluciónHasta 1920x1080
Referencias de personajesHasta 2 por generación (character_id persistente)
Entrada de personajesClip de vídeo (intervalo de marcas de tiempo de 1-3 s), no imágenes estáticas
AudioSincronizado
ExtensiónSí (el clip completo sirve de contexto)
APIAPI de OpenAI + API de Batch

MiniMax Hailuo 02

Hailuo 02 ocupó el segundo puesto mundial en la prueba comparativa de Artificial Analysis cuando se lanzó, superando a Veo 3. Genera clips de 10 segundos en 1080p nativo y ofrece una de las mejores simulaciones físicas del sector. El modelo maneja movimientos extremos, como la gimnasia y las acrobacias, sin deformarse.

Permite generar vídeo a partir de imágenes con una gran coherencia de los personajes gracias al reconocimiento facial y el seguimiento corporal. La arquitectura Noise-aware Compute Redistribution asigna dinámicamente la capacidad de cómputo en función de la complejidad de la escena.

Desde entonces, MiniMax ha superado Hailuo 02 con la familia Hailuo 2.3 (Standard, Pro, Fast y Fast Pro), que mejora las acciones físicas, la estilización y las microexpresiones de los personajes. Genera vídeo en 1080p durante 6 segundos o en 768p durante 10 segundos, y está disponible mediante la plataforma de MiniMax y fal.ai.

Disponibilidad: API comercial. Disponible mediante la plataforma de MiniMax, fal.ai y Replicate. 0,28 $ por vídeo.

EspecificaciónValor
Duración nativa del clipHasta 10 segundos
Resolución1080p nativo
Imágenes de referenciaSí (modo I2V)
AudioNo nativo
FísicaSimulación líder en su categoría
APIMiniMax, fal.ai, Replicate

Luma Ray3.2

Ray2 de Luma ha sido sustituido por la familia Ray3. Ray3 (septiembre de 2025) añadió Character Reference para fijar la identidad y un modo Modify de vídeo a vídeo. Ray3.2 (9 de junio de 2026) añadió control a nivel de fotograma con hasta 16 fotogramas clave por clip, una función Reframe y clips de hasta 20 segundos, además de la primera API pública de la línea Ray3. La salida es 1080p nativo, con 4K disponible mediante el escalado Hi-Fi. La generación de imagen a vídeo admite imágenes de referencia como fotogramas clave iniciales o finales.

Disponibilidad: API e interfaz web de Luma.

EspecificaciónValor
Duración nativa del clipHasta 20 segundos (Ray3.2)
Tipo de referenciaFotogramas clave iniciales/finales + Character Reference (identidad)
Resolución1080p nativo, 4K mediante escalado
Imágenes de referenciaSí (fotogramas clave + referencia de personaje)
APIAPI de Luma

Pika 2.5

Pika adopta un enfoque basado en fotogramas clave con Pikaframes. Sube entre 2 y 5 fotogramas clave (imágenes de referencia en momentos importantes) y el modelo genera transiciones fluidas entre ellos. La duración total alcanza los 20-25 segundos.

Pikascenes admite hasta 10 imágenes de referencia y las combina en un solo vídeo. El modelo utiliza reconocimiento de imágenes para determinar automáticamente la función de cada referencia (personaje, fondo o accesorio).

Disponibilidad: Plataforma web y API de Pika. Planes de suscripción desde el gratuito hasta Pro.

EspecificaciónValor
Duración nativa del clip5-10 segundos
Duración de Pikaframes20-25 segundos
ResoluciónHasta 1080p
Imágenes de referenciaHasta 10 (Pikascenes), 2-5 fotogramas clave (Pikaframes)
API

Nivel 3: modelos de código abierto para flujos de trabajo autoalojados

Estos modelos generan clips más cortos, pero son totalmente abiertos. Puedes ejecutarlos en tu propio hardware, ajustarlos y crear flujos de extensión personalizados sin depender de API.

Wan 2.1 (Alibaba)

Wan 2.1 es la base sobre la que se construyen otros modelos, incluido Helios. La arquitectura Wan-VAE codifica y decodifica vídeo de 1080p de cualquier duración conservando la información temporal. El modelo cuenta con variantes I2V de 480p y 720p, además de un modelo First-Last-Frame-to-Video que genera vídeo entre dos imágenes de referencia.

Wan-Edit permite transferir estilo y contenido mediante imágenes de referencia mientras mantiene estructuras o poses específicas de los personajes. Wan 2.2 (julio de 2025) es la versión abierta más reciente: un modelo de mezcla de expertos con una variante 5B que funciona en una sola RTX 4090 y sigue usando la licencia Apache 2.0. Una advertencia importante para quienes lo autoalojen: Wan dejó de ser abierto a partir de la versión 2.5. Las versiones más recientes Wan 2.5, 2.6 y ahora 2.7 —que ocupa el tercer puesto en la clasificación con audio de Artificial Analysis a mediados de 2026— añadieron audio sincronizado y mayor resolución, pero solo están disponibles mediante API y no ofrecen pesos públicos. Por ello, la versión 2.2 sigue siendo el límite de la oferta abierta. Ignora las páginas orientadas al SEO que afirman que se pueden descargar los pesos de Wan 2.7. La organización oficial de GitHub y la cuenta de Hugging Face solo llegan hasta la versión 2.2.

EspecificaciónValor
Parámetros1.3B, 5B, 14B (2.1); 5B + 14B MoE (2.2)
Modos I2VI2V-480P, I2V-720P, FLF2V-720P
Última versión abiertaWan 2.2 (de 2.5 a 2.7 solo están disponibles mediante API)
LicenciaApache 2.0
HardwareMás de 8 GB de VRAM (variantes más pequeñas)
PlataformasDiffusers, ComfyUI

HunyuanVideo (Tencent)

El modelo de 13B parámetros de Tencent lideró la generación de vídeo de código abierto durante la mayor parte de 2025. HunyuanVideo-I2V utiliza una técnica de sustitución de tokens con un MLLM preentrenado para incorporar información de imágenes de referencia. HunyuanVideo-1.5, publicado en noviembre de 2025, mejoró la eficiencia. HunyuanCustom permite generar vídeo personalizado a partir de entradas multimodales.

EspecificaciónValor
Parámetros13B
I2VSí (técnica de sustitución de tokens)
LicenciaCódigo abierto
HardwareMás de 60 GB de VRAM (720p)
VariantesBase, I2V, 1.5, Avatar, Custom

LTX-2 (Lightricks)

Lightricks publicó LTX-2 como código abierto en enero de 2026, incluidos los pesos completos, el código de inferencia y el código de entrenamiento. Es un modelo basado en DiT que genera vídeo y audio sincronizado de forma conjunta en una sola pasada, con 4K nativo, hasta 50 fps y clips de hasta 20 segundos. Incorpora generación de imagen a vídeo y condicionamiento mediante varios fotogramas clave, por lo que puedes fijar imágenes de referencia en distintos puntos del clip, como harías con Pikaframes.

La licencia es el inconveniente, o quizá no, dependiendo del tamaño de tu empresa. LTX-2 es gratuito para investigación y para uso comercial si los ingresos anuales son inferiores a 10 millones de dólares. Por encima de esa cifra necesitas una licencia comercial, por lo que, en sentido estricto, es un modelo de pesos abiertos en lugar de código abierto. LTX-2.3, el punto de control actual, es una actualización de 22B parámetros con mejor audio y mayor fidelidad al prompt. Los pesos están disponibles en Hugging Face, junto con variantes destiladas de 8 pasos, adaptadores LoRA e integraciones con ComfyUI y Diffusers. También hay API alojadas en la plataforma LTX, fal.ai y Replicate.

EspecificaciónValor
Parámetros22B (LTX-2.3)
Duración máxima del clipAproximadamente 20 segundos
Resolución4K nativo a un máximo de 50 fps
AudioNativo y sincronizado
I2VSí (condicionamiento mediante imagen + varios fotogramas clave)
LicenciaLTX-2 Community License (gratuita por debajo de 10 millones de dólares de ingresos recurrentes anuales)
HardwareVariantes destiladas y FP8 para GPU de consumo

CogVideoX (Tsinghua/Zhipu AI)

CogVideoX utiliza un VAE causal 3D que reduce la longitud de las secuencias y evita el parpadeo. El transformador con LayerNorm adaptativa mejora la correspondencia entre texto y vídeo. Está disponible en variantes 2B (Apache 2.0) y 5B (licencia de investigación), con integración nativa en Diffusers.

Los clips duran entre 6 y 10 segundos a 720x480. Son cortos, pero la relación entre calidad y capacidad de cómputo es buena, y el modelo funciona en una GPU con 12 GB.

EspecificaciónValor
Parámetros2B, 5B
I2VSí (CogVideoXImageToVideoPipeline)
Resolución720x480 a 8 fps
LicenciaApache 2.0 (2B), investigación (5B)
Hardware12 GB de VRAM

Primer fotograma frente a referencia real: la diferencia clave

No todos los sistemas compatibles con «imágenes de referencia» funcionan de la misma manera. Comprender la diferencia es fundamental para elegir el modelo adecuado.

Los modelos de primer fotograma (LongCat, Helios, Hailuo, Luma Ray2, HunyuanVideo) tratan tu imagen como el fotograma inicial literal. El modelo genera la animación a partir de esa imagen exacta. No puedes subir el retrato de un personaje y describirlo en una escena diferente. La imagen es la escena.

Los modelos de referencia real (Kling, Grok Imagine, Seedance, SkyReels V3) extraen la identidad de tu imagen y colocan ese personaje u objeto en cualquier escena que describas. Sube la foto de una persona y utiliza una instrucción como «esa persona camina por un bosque al atardecer». El personaje aparecerá en un entorno completamente nuevo, pero conservará su identidad. Esto es lo que necesitas para contenido narrativo con varias escenas, como una película de aventuras.

Los modelos de ID de personaje (Sora 2 Pro) extraen la identidad de clips de vídeo en lugar de imágenes estáticas. Creas una vez un ID de personaje persistente y lo reutilizas en un número ilimitado de generaciones futuras.

Los modelos de estilo o ingredientes (Veo 3.1) utilizan imágenes de referencia para influir en el estilo visual, las texturas y el aspecto general, en lugar de extraer identidades concretas de personajes. Son buenos para mantener la coherencia visual de un proyecto, pero menos precisos para controlar personajes individuales.

El flujo de trabajo real para vídeos de 10 minutos

Esta es la realidad a mediados de 2026. Ningún modelo genera de forma fiable 10 minutos de vídeo coherente y de alta calidad en una sola pasada. LongCat Video es el que más se acerca, con una duración anunciada de 15 minutos, pero la calidad y la coherencia varían considerablemente con esas duraciones. Helios y SkyReels V2 generan vídeos «de varios minutos» y de «duración infinita», respectivamente, pero los resultados requieren instrucciones cuidadosamente elaboradas y, a menudo, varios intentos.

El flujo de trabajo que realmente funciona para la mayoría de los creadores que producen vídeos de entre 5 y 15 minutos combina varios enfoques:

Para contenido con bustos parlantes o avatares: el modo de LongCat Video de 2026 basado en audio o la generación de avatares de SkyReels V3 pueden producir más de 5 minutos de un personaje parlante coherente. Es lo más parecido a «pulsar un botón y obtener un vídeo largo».

Para contenido narrativo con varias escenas, como una película de aventuras: utiliza Kling 3.0, Grok Imagine o Seedance 2.0 con imágenes de referencia reales del personaje. Genera planos individuales de entre 10 y 15 segundos. Utiliza las mismas referencias @Element o <IMAGE> en cada generación para mantener la identidad del personaje. Encadena los planos mediante el modo multiplano —Kling admite 6 planos por llamada— o la API de extensión. Kling es la opción más probada para este flujo de trabajo. La separación explícita de Grok Imagine entre el «modo de referencia» y el «modo de primer fotograma» lo convierte en una alternativa sólida. Seedance 2.0 admite el mayor número de entradas de referencia —12 archivos—, pero es más reciente y está menos probado.

Para mantener la coherencia de los personajes entre muchos clips: el sistema persistente character_id de Sora 2 Pro es el enfoque más sencillo para proyectos muy largos. Extrae el personaje una sola vez de un vídeo corto y genera después decenas de clips que hagan referencia a ese ID. La identidad del personaje no se degrada con el tiempo porque se almacena como una incrustación persistente, en lugar de reinterpretarse a partir de una imagen en cada ocasión.

Para contenido con transferencia de estilo: Lucy Restyle en fal.ai procesa vídeos existentes de hasta 30 minutos y aplica transformaciones de estilo mediante IA mientras conserva el movimiento. Si dispones de material original, este método evita por completo el problema de la duración de generación. Cuesta 0,01 $ por segundo de vídeo original.

Para flujos de trabajo de código abierto: utiliza Wan 2.1 o Helios con un bucle de continuación de vídeo. Genera un clip, emplea su último fotograma como fotograma inicial del siguiente y repite el proceso. Los flujos de trabajo de ComfyUI lo automatizan. La coherencia se degrada tras muchas iteraciones, pero es gratuito y controlable.

El reto principal sigue siendo el mismo: incluso con compatibilidad con imágenes de referencia reales, la deriva del personaje se acumula a lo largo de decenas de clips. Los rasgos faciales, el cabello, la ropa y el tono de piel cambian gradualmente. Las soluciones alternativas —fotos de referencia de alta calidad, instrucciones coherentes y generación de planos por lotes— son necesarias. Sin embargo, modelos como Kling y Grok Imagine, que separan la identidad del personaje de la composición de la escena, facilitan enormemente este proceso en comparación con los modelos limitados al primer fotograma.

El enfoque del armazón 3D: renderizar con baja calidad y transformar con alta calidad

Está ganando popularidad un flujo de trabajo que evita por completo la mayoría de los problemas de la generación de larga duración. En lugar de pedir a un modelo de IA que genere 10 minutos de vídeo desde cero, renderizas una cinemática 3D de baja fidelidad con el trabajo de cámara, la puesta en escena de los personajes y los tiempos correctos; después, la procesas con un modelo de vídeo a vídeo usando imágenes de referencia y una instrucción de mejora. El motor 3D se encarga de la estructura. La IA se ocupa de la estética.

Esto funciona porque la transformación V2V es un problema más acotado que la generación completa. El modelo no necesita inventar el movimiento de cámara, la posición de los personajes ni la composición de la escena. Solo tiene que dar un aspecto fotorrealista al metraje existente mientras sigue tus referencias visuales. Es un problema mucho más abordable y puede ampliarse a cualquier duración que tu motor 3D sea capaz de renderizar.

Por qué funciona

Tu motor 3D te proporciona todo aquello con lo que los modelos de vídeo por IA todavía tienen dificultades: control preciso de la cámara, colocación exacta de los personajes dentro del encuadre, interacciones físicas correctas y tiempos coherentes durante varios minutos de metraje. Zooms de dolly, planos de seguimiento y personajes que entran o salen del encuadre en el momento preciso: todo esto es trivial en un motor 3D, pero poco fiable en una generación basada en instrucciones de texto. La única tarea del modelo V2V es transformar los materiales, la iluminación y las texturas en un resultado fotorrealista, conservando la geometría y el movimiento que ya has definido.

También resulta más fácil mantener la coherencia de los personajes. En lugar de combatir la deriva de identidad a lo largo de 50 generaciones de IA independientes, muestras al modelo el mismo personaje 3D en cada fotograma. Las imágenes de referencia indican al modelo qué aspecto debe tener ese personaje en el resultado final. Es un problema más sencillo que generar desde cero un personaje coherente cada vez.

Además, la duración deja de ser una limitación. Lucy Restyle procesa 30 minutos en una sola llamada. Wan 2.1 en ComfyUI puede procesar cualquier duración por fragmentos. Ya no tienes que resolver el problema de «cómo genero 10 minutos», porque el metraje ya existe.

RealMaster (Meta / Universidad de Tel Aviv)

RealMaster es un sistema de investigación creado específicamente para este flujo de trabajo. Publicado en marzo de 2026 por Meta Reality Labs y la Universidad de Tel Aviv, transforma vídeo 3D renderizado en vídeo fotorrealista y mantiene una alineación geométrica completa con el material de origen.

El método extrae mapas de bordes del renderizado 3D para conservar la estructura y el movimiento; después, aplica un modelo de difusión de vídeo —basado en la arquitectura VACE/Wan— para transformar todo lo demás en un resultado fotorrealista. Un adaptador IC-LoRA ligero destila el flujo de trabajo en una única pasada de inferencia que no necesita fotogramas de anclaje y puede procesar objetos que aparecen a mitad de la secuencia.

En pruebas con secuencias de los simuladores GTA-V y CARLA, RealMaster supera considerablemente a los sistemas de referencia de edición de vídeo de uso general. También puede añadir efectos meteorológicos mediante instrucciones de texto —«Haz que llueva», «Haz que nieve»— sobre la transformación fotorrealista. El modelo se generaliza entre simuladores sin necesidad de reentrenamiento. Los pesos entrenados con datos de GTA-V funcionan con resultados de CARLA sin ningún ajuste adicional.

Disponibilidad: solo para investigación. Todavía no hay pesos públicos ni API.

EspecificaciónValor
EntradaVídeo 3D renderizado (cualquier motor)
SalidaVídeo fotorrealista que conserva la geometría y el movimiento
ArquitecturaIC-LoRA sobre una base de difusión de vídeo VACE/Wan
CondicionamientoMapas de bordes del renderizado de origen
Probado conSimulador GTA-V, CARLA
LicenciaNo publicado (solo artículo de investigación)

Herramientas V2V de producción disponibles actualmente

Kling 3.0 V2V con referencias de elementos es la opción de producción más completa. Los endpoints Edit Video y Reference V2V de fal.ai aceptan clips de vídeo de origen de entre 3 y 10 segundos, junto con referencias de elementos (@Element1, @Element2 con fotos frontales y desde varios ángulos) y una instrucción de mejora. El modelo analiza las trayectorias de movimiento y los patrones de cámara del material de origen, y después vuelve a generar el metraje con las apariencias de personajes y el estilo visual especificados, conservando la puesta en escena y el trabajo de cámara originales. Admite hasta 7 entradas de referencia. Genera resultados a 1080p. Procesa tu cinemática en fragmentos de entre 10 y 15 segundos y utiliza las mismas referencias de elementos en todos ellos para mantener la coherencia de los personajes.

Lucy Restyle 2 procesa hasta 30 minutos de vídeo de origen en una única llamada a la API, a un precio de 0,01 $ por segundo de entrada. Admite una instrucción de texto y una imagen de referencia opcional como guía de estilo. No ofrece referencias de elementos por personaje como Kling, pero es la opción más sencilla y económica para transferir un estilo cinematográfico general a un renderizado 3D completo. Proporciónale el renderizado completo y una instrucción que describa el aspecto deseado. Genera resultados a 720p con coherencia temporal a lo largo de miles de fotogramas.

Wan 2.1 VACE en ComfyUI es la alternativa de código abierto. El modelo VACE 14B realiza transformaciones V2V guiadas por referencias: recibe un vídeo de origen y una imagen de referencia de estilo, y genera una versión con otro estilo que conserva la estructura y el movimiento. El condicionamiento mediante mapas de bordes mejora la fidelidad estructural. Puedes crear un bucle de procesamiento que gestione cualquier duración por fragmentos, utilizando referencias de estilo coherentes. Es gratuito y se ejecuta localmente en tu propio hardware.

Grok Imagine V2V admite un vídeo de origen y entre 1 y 7 imágenes de referencia en el modo de referencia. Cuesta 0,05 $ por segundo a 720p. La separación explícita entre el modo de referencia y el modo de primer fotograma permite que tus referencias guíen la apariencia de los personajes sin sustituir la estructura del vídeo de origen.

Qué necesita tu renderizado 3D

El umbral mínimo de calidad del renderizado es importante. Una simple malla de alambre no proporciona al modelo V2V suficiente información. Sin embargo, tampoco necesitas materiales o iluminación con calidad de producción.

Proporciones y geometría correctas. Los modelos de personajes necesitan proporciones corporales y una estructura facial aproximadamente correctas para que las imágenes de referencia se proyecten adecuadamente. Basta con una geometría humanoide básica con las proporciones correctas. Una figura de palitos no producirá un personaje reconocible.

Dirección básica de la iluminación. Una única luz direccional que establezca la iluminación general de la escena ayuda al modelo a comprender el ambiente deseado. La IA mejorará y añadirá detalles, pero necesita saber si la escena transcurre a plena luz del día o en un interior oscuro.

Movimiento de cámara fluido. Los movimientos de cámara estables e intencionados se transfieren bien. Los movimientos erráticos o extremadamente rápidos pueden confundir a los modelos V2V. Haz que tu cámara virtual se comporte como lo haría una cámara real.

Sombreado plano en lugar de malla de alambre. Una geometría sencilla con sombreado plano o pocos polígonos ofrece mejores resultados que las mallas de alambre o los modelos sin texturas. Incluso unos colores sólidos básicos en las superficies ayudan al modelo a comprender los límites de los materiales.

Coste y escala

Procesamiento de una cinemática de 10 minutos con distintas herramientas:

HerramientaDuración máxima de entradaCoste para 10 minResoluciónImágenes de referencia
Kling O3 V2VClips de 10 s~50-67 $1080pHasta 7 (elementos + estilo)
Lucy Restyle 230 minutos6 $720p1 (solo estilo)
Grok Imagine V2VClips de 10 s~30 $720p1-7
Wan 2.1 VACECualquiera (por fragmentos)Gratis (GPU local)720p1 por fragmento

Lucy Restyle es la opción más económica para procesar vídeos completos. Kling es la más precisa para mejorar personajes concretos mediante referencias de elementos. Wan 2.1 es gratuito si dispones del hardware necesario —requiere unos 60 GB de VRAM para el modelo 14B a 720p, u 8 GB para la variante 1.3B con una calidad inferior—.

Tabla comparativa

ModeloDuración nativa máximaDuración ampliadaTipo de referenciaMáx. de referenciasResoluciónAPI disponibleCódigo abierto
LongCat Video~15 minN/DSolo primer fotograma1720p/30 fpsSí (fal.ai)Sí (MIT)
Seaweed APT2~5 minN/DI2V + pose1720pNoNo
HeliosVarios minutosN/DPrimer fotograma (I2V)1720pHF SpacesSí (Apache 2.0)
SkyReels V3IlimitadaN/DReferencia real1-4720pNo
Kling 3.015 s~3 minElementos + referencias de estilo71080pNo
Grok Imagine15 sEncadenableReferencia real7720pNo
Seedance 2.015 sN/DReferencias multimodales122KNo
Runway Gen-4.510 s~1 minI2V (0-1)11080pNo
Veo 3.18 s~2,5 minIngredientes (estilo)34KNo
Gemini Omni Flash10 sEdiciones conversacionalesReferencias multimodalesImágenes + vídeo720pSí (vista previa)No
Sora 2 Pro ⚠️ se retirará20 sEncadenableID de personaje (vídeo)21080pLa API se retira en sep. de 2026No
Hailuo 0210 sN/DI2V (primer fotograma)11080pNo
Luma Ray3.220 sN/DFotogramas clave + referencia de personaje16 fotogramas clave1080p (reescalado a 4K)No
Pika 2.510 s25 sPikascenes101080pNo
Wan 2.1Clips cortosMediante continuaciónI2V / FLF2V1-2720pMediante fal.aiSí (Apache 2.0)
HunyuanVideoClips cortosMediante continuaciónI2V (primer fotograma)1720pMediante fal.ai
LTX-2.320 sMediante continuaciónI2V + fotogramas claveVarios fotogramas clave4KSí (LTX, fal.ai)Pesos (limitados por ARR)
CogVideoX6-10 sMediante continuaciónI2V (primer fotograma)1720x480Mediante fal.ai

Próximamente

La trayectoria hasta 2026 está clara. LongCat Video demostró que la generación a escala de minutos y con coherencia es posible en un modelo abierto. Helios mostró que puede hacerse en tiempo real. Seaweed APT2 demostró la generación interactiva de larga duración. Y los modelos con referencias reales (Kling, Grok, Seedance) demostraron que la identidad de los personajes puede mantenerse en escenas arbitrarias.

El siguiente paso es combinar estas capacidades: generación nativa de larga duración con compatibilidad real con referencias de personajes. Ahora mismo hay que elegir una u otra. Cuando un modelo pueda generar 5 minutos de vídeo manteniendo los personajes de las imágenes de referencia a lo largo de decenas de cambios de escena, el flujo de trabajo basado en encadenar clips quedará obsoleto. Las especificaciones anunciadas de Seedance 2.5 (clips nativos de 30 segundos, hasta 50 archivos de referencia y apertura de la API el 16 de julio de 2026) son el primer paso real en esa dirección.

A mediados de julio de 2026, la clasificación de texto a vídeo (con audio) de Artificial Analysis está liderada por Gemini Omni Flash de Google (~1240 Elo), seguido de Seedance 2.0, Wan 2.7 de Alibaba —disponible solo mediante API— y los modelos HappyHorse; las variantes de Kling 3.0, SkyReels V4 y Veo 3.1 les siguen de cerca. La clasificación cambia con frecuencia, así que cualquier posición concreta debe considerarse una instantánea y no un orden fijo.

El enfoque basado en un armazón 3D ofrece una trayectoria paralela. A medida que los modelos V2V mejoran su preservación estructural y su fotorrealismo, perfeccionar renderizados 3D de baja fidelidad resulta cada vez más viable para producciones completas. RealMaster de Meta ya logra transformaciones de simulación a realidad con calidad de investigación a partir de resultados de motores de videojuegos. Cuando esta capacidad llegue a las API de producción con compatibilidad con imágenes de referencia, cualquiera con conocimientos básicos de 3D podrá producir vídeos fotorrealistas de larga duración con control total sobre la cámara, la puesta en escena y la ubicación de los personajes, sea cual sea la duración.

Por ahora, la respuesta práctica depende de tu caso de uso:

Mejor para referencias de varios personajes: Kling 3.0 (hasta 7 referencias con sistemas separados de elementos y estilo) o Seedance 2.0 (hasta 12 entradas multimodales, que aumentarán a 50 cuando se abra la API de Seedance 2.5 el 16 de julio de 2026).

Mejor API para generar vídeo a partir de referencias: Grok Imagine (API sencilla, modo de referencia explícito, 0,05 $/s) o Kling mediante fal.ai (0,084-0,112 $/s).

Mejor para mantener personajes en muchos clips: las referencias de elementos de Kling 3.0 o la función de referencia y extensión de SkyReels V3. (El sistema de ID de personajes de Sora 2 Pro era el enfoque más limpio, pero se retirará en 2026, así que no empieces nuevos proyectos con él).

Mejor opción de código abierto: SkyReels V3 (entre 1 y 4 imágenes de referencia reales, duración ilimitada) o Helios (tiempo real, Apache 2.0).

Mejor para duración pura: LongCat Video (~15 min, pero solo admite el primer fotograma).

Mejor para mejorar renderizados 3D: Kling 3.0 V2V (referencias de elementos por personaje, 1080p) o Lucy Restyle 2 (entrada de 30 min, 0,01 $/s).


Preguntas frecuentes

¿Cuál es el mejor modelo de vídeo con IA para vídeos largos?

En cuanto a duración pura, LongCat Video genera de forma nativa unos 15 minutos, aunque solo admite el primer fotograma. Para vídeos largos con personajes coherentes, la respuesta práctica en 2026 es un flujo de trabajo de referencia y extensión: genera clips con un modelo que ofrezca buena compatibilidad con referencias (Kling 3.0, Runway Gen-4.5 o SkyReels V3, de código abierto) y encadénalos. Ningún modelo ofrece a la vez una gran duración y una conservación perfecta de la identidad de los personajes, por lo que la mayoría de las producciones combinan varios modelos.

¿Qué modelos de vídeo con IA admiten imágenes de referencia?

Entre las opciones comerciales, Kling 3.0 Omni, Runway Gen-4.5, Seedance 2.0, Google Veo 3.1 y Gemini Omni Flash admiten imágenes de referencia. En cuanto al código abierto, SkyReels V2/V3, Wan 2.1 y LTX-2 aceptan entradas de referencia que puedes ejecutar por tu cuenta. La calidad de esta compatibilidad varía mucho, por eso la guía anterior los divide en niveles.

¿Puede la IA generar un personaje coherente a lo largo de un vídeo?

Sí, pero no de una sola vez. El enfoque fiable consiste en fijar un personaje mediante una o varias imágenes de referencia, generar clips cortos y ampliarlos o unirlos mientras se vuelven a proporcionar las mismas referencias. La compatibilidad con referencias reales (el modelo conserva la identidad en nuevas generaciones) importa mucho más en este caso que el condicionamiento mediante el primer fotograma, que solo establece el fotograma inicial.

¿Qué diferencia hay entre admitir un primer fotograma y admitir imágenes de referencia reales?

El condicionamiento mediante el primer fotograma usa tu imagen como fotograma inicial literal del clip y después se desvía progresivamente a medida que avanza el vídeo. La compatibilidad con referencias reales trata la imagen como un ancla de identidad que el modelo respeta durante toda la generación, de modo que un personaje o estilo se mantiene coherente a lo largo de todo el clip y entre clips separados. La sección anterior detalla qué hace cada modelo.


Contenido relacionado

Pruébalo ahora mismoHaz que la escena sea jugable en lugar de renderizarla

Sáltate la cola de renderizado y recórrela en directo.

Créalo gratis →Es gratis, funciona en tu navegador, nada que instalar.