Skip to content

Meilleurs modèles vidéo IA prenant en charge les images de référence (2026) ​

Dernière mise à jour : septembre 2026.

Générer un clip de 10 secondes est facile désormais. Tous les modèles majeurs y parviennent. La vraie question est : peut-on générer 5 ou 10 minutes de vidéo cohérente où un personnage garde la même apparence à la minute une et à la minute huit ? Où la scène reste cohérente sur des centaines d'images ?

C'est là que se trouve le vrai défi. Et c'est là que les choses évoluent rapidement. Ce guide couvre tous les modèles que nous avons trouvés qui génèrent nativement de la vidéo longue ou qui prennent en charge les workflows nécessaires pour créer du contenu longue durée avec des personnages cohérents grâce aux images de référence. Nous les répartissons en trois catégories : les modèles qui génèrent directement des vidéos de plusieurs minutes, les modèles avec une forte prise en charge des images de référence que vous prolongez par continuation, et les options open source que vous pouvez héberger vous-même.

Catégorie 1 : génération longue durée native (minutes et plus) ​

Ces modèles génèrent des vidéos mesurées en minutes, pas en secondes. Ils sont conçus dès le départ pour assurer la cohérence temporelle sur de longues séquences.

LongCat Video ​

Meituan a lancé LongCat Video fin 2025. C'est un transformeur de diffusion à 13,6 milliards de paramètres, et c'est le premier modèle capable de générer de manière fiable une vidéo cohérente jusqu'à 15 minutes.

Le modèle prend en charge le texte-vers-vidéo, l'image-vers-vidéo, et la continuation vidéo dans un pipeline unifié. En mode I2V, l'image d'entrée devient littéralement la première image de la vidéo. Ce n'est pas une référence de personnage libre que vous pouvez placer dans n'importe quelle scène. Le modèle anime la suite à partir de cette image de départ tout en utilisant le « Cross-Chunk Latent Stitching » pour continuer à référencer l'image d'origine tout au long de la génération, évitant la dérive des couleurs et maintenant la cohérence visuelle sur de longues séquences. Une variante 2026 mise à jour ajoute la génération d'avatars pilotée par l'audio avec synchronisation labiale pour des vidéos de tête parlante de plus de 5 minutes.

En coulisses, LongCat utilise une approche de génération du grossier au fin avec du Block Sparse Attention pour gérer les longueurs de séquence massives. Le réglage RLHF améliore la qualité du mouvement. Sur le benchmark VBench 2.0, il se classe troisième au global, derrière Google Veo 3 et Vidu Q1 de Shengshu.

Disponibilité : Open source sous licence MIT. Disponible via l'API fal.ai à 0,04 $ par seconde générée (36 $ pour une vidéo de 15 minutes en 720p). Également disponible via la plateforme propre de LongCat avec une tarification basée sur des crédits.

CaractéristiqueValeur
Durée maximale~15 minutes
Résolution720p à 30 im/s
Paramètres13,6 Md
Images de référencePremière image uniquement (mode I2V, pas de référence de personnage)
LicenceMIT
Coût API~0,04 $/seconde (fal.ai)

Seaweed APT2 ​

Seaweed APT2, de ByteDance, adopte une approche différente. Au lieu de générer une vidéo complète à l'avance, il produit des images de manière autorégressive à 24 im/s avec seulement 0,16 seconde de latence par image sur un seul H100. Le résultat est une vidéo stable jusqu'à 5 minutes avec une cohérence temporelle qui tient la route.

L'astuce technique est l'entraînement post-hoc adversarial autorégressif (AAPT), qui convertit un modèle de diffusion vidéo bidirectionnel pré-entraîné en un générateur autorégressif unidirectionnel. Une seule évaluation directe du réseau par image. C'est ce qui rend possible la génération en temps réel.

Ce qui rend ce modèle intéressant au-delà de la seule durée brute, c'est l'interactivité. Vous pouvez contrôler la caméra, animer des personnages via la détection de pose, et manipuler les scènes pendant que la vidéo se rend. Pensez-y moins comme « générer une vidéo » que comme « piloter une vidéo en temps réel ».

Disponibilité : Phase de recherche uniquement. Pas encore disponible publiquement. Le modèle de base 7B (Seaweed-7B) a un article publié mais les poids d'APT2 n'ont pas été diffusés.

CaractéristiqueValeur
Durée maximale~5 minutes
Résolution736x416 (GPU unique), jusqu'à 720p (8 GPU)
Paramètres8 Md
Images de référenceVia I2V et contrôle de pose interactif
LicenceNon diffusée
StatutAperçu de recherche

Helios ​

Helios vient de l'Université de Pékin, construit sur Wan 2.1. C'est un modèle à 14 milliards de paramètres qui génère de la vidéo à l'échelle de la minute à 19,5 im/s sur un seul H100. L'innovation clé est la façon dont il gère la dérive sur les vidéos longues. Au lieu d'utiliser des techniques anti-dérive conventionnelles comme le self-forcing ou l'échantillonnage d'images clés, Helios simule la dérive pendant l'entraînement afin que le modèle apprenne à la corriger.

Il prend nativement en charge les tâches texte-vers-vidéo, image-vers-vidéo, et vidéo-vers-vidéo. Le mode I2V accepte des images de référence pour amorcer la génération.

Disponibilité : Entièrement open source sous licence Apache 2.0. Publié en mars 2026. Code et poids sur GitHub (PKU-YuanGroup/Helios). Intégré à Diffusers, SGLang, et vLLM-Omni. Démo Gradio sur HuggingFace Spaces.

CaractéristiqueValeur
Durée maximaleÉchelle de la minute (pas de plafond fixe)
Résolution720p
Paramètres14 Md
Images de référenceOui (mode I2V)
LicenceApache 2.0
MatérielUn seul H100 pour le temps réel

SkyReels V2 / V3 ​

SkyReels V3 accepte 1 à 4 images de référence et génère des vidéos de durée illimitée avec changement de plan multi-shot et synthèse d'avatar guidée par audio.

La gamme SkyReels de Skywork vise la vidéo de longueur infinie. V2 utilise une architecture AutoRegressive Diffusion-Forcing qui génère de la vidéo sans plafond de durée fixe. V3, sorti en janvier 2026, unifie l'image-vers-vidéo par référence, l'extension vidéo-vers-vidéo, et la génération d'avatar guidée par audio dans un seul modèle.

V3 accepte 1 à 4 images de référence et préserve l'identité du sujet tout au long de la vidéo générée. Le mode vidéo-vers-vidéo permet une continuation transparente en un seul plan et un changement de plan multi-shot avec des transitions cinématographiques.

Skywork a annoncé SkyReels V4 le 25 février 2026, un modèle à double flux qui génère vidéo et audio ensemble jusqu'à 1080p/32 im/s et accepte texte, images, clips vidéo, masques, et audio comme entrées de conditionnement. Une correction par rapport à notre article de juillet : V4 n'a pas été mis en open source. En septembre 2026, l'organisation GitHub SkyworkAI dispose de dépôts pour V1 à V3 et Matrix-Game, mais aucun poids ni API publique pour V4, donc V3 reste le plafond référence-vers-vidéo open source de Skywork.

Disponibilité : Entièrement open source. Modèles de 1,3 Md à 14 Md de paramètres. Disponible en 540p et 720p. Code et poids sur GitHub et HuggingFace.

CaractéristiqueValeur
Durée maximaleIllimitée (autorégressive)
Résolution540p, 720p
Paramètres1,3 Md, 5 Md, 14 Md
Images de référence1 à 4 images (V3)
LicenceOpen source
MatérielMinimum RTX 4090, recommandé 4-8x A100

Catégorie 2 : clips courts avec forte prise en charge des références + extension ​

Ces modèles génèrent des clips de 8 à 60 secondes mais offrent une forte prise en charge des images de référence et des fonctionnalités d'extension vidéo. Pour du contenu longue durée, vous enchaînez les clips en utilisant les points d'accès de continuation ou d'extension du modèle. La cohérence des personnages provient des images de référence qui persistent d'une génération à l'autre.

C'est le workflow pratique que la plupart des créateurs utilisent aujourd'hui pour du contenu de plus d'une minute. La qualité par clip est souvent supérieure à celle des modèles longue durée natifs.

Kling 3.0 Omni (Kuaishou) ​

Kling 3.0 Omni combine des éléments de personnage, des références de style, et un storyboard multi-shot en un seul appel avec une sortie native 4K 60 im/s.

Kling possède le système de référence d'image le plus complet de tous les modèles vidéo. Il sépare les entrées de référence en trois catégories distinctes, chacune ayant un objectif différent :

Images de référence (image_urls) : jusqu'à 4 images pour guider le style et l'apparence. Vous les identifiez dans votre prompt sous la forme @Image1, @Image2, etc. Elles influencent l'apparence générale, le style de scène, et l'environnement sans être la première image.

Éléments (elements) : entrées dédiées aux personnages/objets. Chaque élément prend une frontal_image_url (photo claire de face) plus des reference_image_urls optionnelles (angles supplémentaires). Vous les référencez sous la forme @Element1, @Element2 dans votre prompt. Le modèle extrait l'identité du personnage et le place dans n'importe quelle scène que vous décrivez. C'est la fonctionnalité clé pour du contenu de type film d'aventure : téléchargez une photo de personnage, puis décrivez-le en train de marcher dans une forêt, de combattre un dragon, tout ce que vous voulez.

Images de début/fin (start_image_url, end_image_url) : épinglez des images spécifiques comme première ou dernière image. Ce sont des images littérales, pas des guides de style.

Le total sur les trois catégories est jusqu'à 7 entrées de référence (réduit à 4 lors de l'utilisation simultanée d'une vidéo de référence). Un seul prompt comme "@Element1 and @Element2 are having dinner at this table on @Image1" peut combiner des personnages avec des références de scène.

Pour du contenu longue durée, Kling propose deux voies. Le mode multi-shot génère jusqu'à 6 scènes en un seul appel, chacune avec son propre prompt et sa propre durée (3 à 15 s chacune). Les éléments de personnage persistent automatiquement sur tous les plans. L'API d'extension continue à partir de là où une vidéo terminée s'est arrêtée, atteignant environ 3 minutes grâce à des extensions chaînées. Le mode d'édition V2V prend une vidéo existante (3 à 10 secondes) et la transforme en utilisant des références d'éléments et un prompt textuel, préservant le mouvement de caméra et la mise en scène des personnages de la source tout en restylisant les personnages et environnements selon vos références. Cela rend Kling particulièrement utile pour améliorer des séquences préexistantes, y compris des rendus 3D basse fidélité.

Kling 3.0 Omni unifie texte-vers-vidéo, image-vers-vidéo, référence-vers-vidéo, et édition vidéo dans un seul modèle avec génération audio native et synchronisation labiale. En juin 2026, Kuaishou a ajouté Kling 3.0 Turbo, une variante plus rapide et moins chère avec l'audio inclus en 720p et 1080p, et a mis à niveau le pipeline d'édition d'Omni pour accepter et produire de la vidéo 4K. Aucun Kling 3.5 ou 4.0 n'a été lancé en date de septembre 2026, donc 3.0 Omni reste le modèle vidéo actuel.

Disponibilité : API commerciale via Kuaishou, fal.ai, et Replicate, avec une tarification par seconde qui varie selon la résolution et la variante. Interface web sur klingai.com.

CaractéristiqueValeur
Durée native du clip3 à 15 secondes
Durée étendue~3 minutes (via extensions chaînées)
Résolution720p, 1080p (4K en édition Omni)
Images de référenceJusqu'à 4 (références de style @Image)
ÉlémentsJusqu'à 4 (références de personnage @Element avec vue de face + angles)
Total des référencesJusqu'à 7 combinées (4 avec référence vidéo)
Multi-shotOui (jusqu'à 6 plans en storyboard)
AudioAudio synchronisé natif + synchronisation labiale
Édition vidéoOui (édition guidée par texte de vidéo existante)
APIKuaishou, fal.ai, Replicate

Kling image-vers-vidéo avec plusieurs images de référence ​

C'est la question qu'on nous pose le plus souvent à propos de Kling, voici donc la version courte du fonctionnement de la référence multi-image dans le modèle actuel, tirée du guide VIDEO 3.0 Omni de Kling lui-même. L'image-vers-vidéo standard prend une image et l'anime comme première image. La référence multi-image est un mode différent : vous téléchargez plusieurs images, les identifiez dans le prompt, et le modèle compose un nouveau plan à partir d'elles. Sans vidéo de référence dans la requête, vous pouvez joindre jusqu'à 7 images et éléments combinés, et avec une vidéo de référence, cela redescend à 4. Un seul élément de personnage peut lui-même être construit à partir de jusqu'à 4 photos sous différents angles, ou à partir d'un clip vidéo d'un seul personnage de 3 à 8 secondes, et vous pouvez y associer un enregistrement vocal de 5 à 30 secondes pour que le personnage garde la même voix d'un plan à l'autre. Dans le prompt, vous les référencez sous la forme @Image1 pour une référence de style ou de scène et @Element1 (ou le nom que vous avez donné à l'élément) pour un personnage ou un objet verrouillé, ainsi un prompt comme « @Grace walks through @Image1 at dusk » place un personnage cohérent dans une scène que vous avez fournie. La sortie va jusqu'à 15 secondes en 720p ou 1080p avec audio natif, et la même bibliothèque d'éléments se reporte dans le storyboard multi-shot de Kling, ce qui permet de garder un personnage cohérent sur une séquence de six plans. Si vous n'avez besoin que d'images fixes cohérentes plutôt que de vidéo, Kling IMAGE 3.0 accepte jusqu'à 10 images de référence selon son guide image, et un workflow courant consiste à verrouiller d'abord le personnage là, puis à réinjecter ces images fixes comme éléments.

Grok Imagine (xAI) ​

Grok Imagine sépare le mode référence du mode première image, vous permettant d'identifier jusqu'à 7 images comme références de personnage ou d'objet dans votre prompt.
xAI a lancé le mode Reference-to-Video de Grok Imagine début 2026, avec la prise en charge de 1 à 7 images de référence. La documentation distingue explicitement cela de l'image-to-video : « Contrairement à l'image-to-video où l'image source devient la première image, les images de référence influencent ce qui apparaît dans la vidéo sans figer la première image. »

Vous marquez les images dans votre prompt sous forme de <IMAGE_1>, <IMAGE_2>, etc. Un prompt comme "the model from <IMAGE_1> walks onto the runway wearing the shirt from <IMAGE_2>" combine une référence de personne avec une référence de vêtement. Le modèle gère l'essayage virtuel, le placement de produit et la narration à personnage cohérent sur plusieurs scènes.

Une contrainte : vous ne pouvez pas combiner des images de référence avec l'image-to-video dans la même requête. C'est soit le mode première-image, soit le mode référence, pas les deux.

Grok Imagine dispose également d'un point de terminaison d'extension vidéo qui ajoute de nouvelles séquences à la fin d'une vidéo existante. Le paramètre duration contrôle uniquement la nouvelle portion. Vous pouvez enchaîner les extensions pour créer un contenu plus long.

xAI a publié Grok Imagine 1.5 en aperçu API le 3 juin 2026, puis l'a rendu disponible en accès général sous le nom grok-imagine-video-1.5 le 16 juin, avec une variante Fast déployée sur les applications grand public. C'est un modèle image-to-video qui anime une seule image fixe en un mouvement cinématique avec des mouvements de caméra, une atmosphère, de la physique, et un audio synchronisé généré nativement dans la même passe d'inférence. Il prend en charge le séquençage multi-plans pour enchaîner des scènes cohérentes, génère un clip 720p de 6 secondes en environ 25 secondes, et se classait troisième sur l'arène image-to-video d'Artificial Analysis à son lancement. En septembre 2026, la page des modèles de xAI liste Grok Imagine Video 1.5 à $0,08 par seconde et le Grok Imagine Video original à $0,05 par seconde. Le plus récent Grok Imagine Image 2.0 de xAI (répertorié dans ses notes de version) est un modèle d'image fixe, utile pour verrouiller un personnage avant de l'animer, mais ce n'est pas un nouveau modèle vidéo.

Disponibilité : API xAI (lancée en janvier 2026), fal.ai et Replicate. SDK Python, JavaScript/AI SDK et API REST. 0,05 $/sec en 720p avec audio. Également disponible pour les abonnés X Premium.

SpécificationValeur
Durée de clip native1 à 15 secondes
Durée étendueEnchaînable via l'API d'extension
Résolution480p, 720p
Images de référence1 à 7 (véritable référence, pas première-image)
Balises de prompt<IMAGE_1>, <IMAGE_2>, etc.
AudioOui (720p)
Édition vidéoOui (guidée par texte)
APIAPI xAI, fal.ai, Replicate
Coût API$0,05/seconde (Video), $0,08/seconde (Video 1.5)

Seedance 2.0 (ByteDance) ​

Seedance 2.0 accepte jusqu'à 12 entrées multimodales simultanément et génère des vidéos avec synchronisation audio native et synchronisation labiale au niveau des phonèmes dans plus de 8 langues.

Seedance 2.0 de ByteDance accepte le plus grand nombre d'entrées de référence de tous les modèles : jusqu'à 12 fichiers simultanément, dont jusqu'à 9 images, 3 vidéos et 3 fichiers audio. Le modèle prend en charge la génération audio-vidéo native avec synchronisation labiale au niveau des phonèmes dans plus de 8 langues.

Chaque image individuelle peut peser jusqu'à 30 Mo. Les vidéos de référence doivent durer entre 2 et 15 secondes. Le modèle utilise les références pour l'apparence des personnages, le style de la scène et le guidage du mouvement.

Le saut suivant a désormais eu lieu. ByteDance a annoncé Seedance 2.5 lors de sa conférence Volcano Engine FORCE le 23 juin 2026 et l'a publié le 31 juillet 2026. Selon l'annonce de l'équipe Seed, il génère un seul clip natif allant jusqu'à 30 secondes avec des extensions multi-rounds, accepte jusqu'à 30 images, 10 clips vidéo et 10 clips audio comme références en une seule passe (50 fichiers, contre 12 auparavant), et ajoute une édition au niveau de l'horodatage permettant de modifier un seul moment d'un clip sans le régénérer entièrement. Il est d'abord arrivé sur Jimeng et Doubao, puis sur l'API entreprise BytePlus ModelArk, et des tiers l'ont adopté rapidement : l'API de Runway a ajouté Seedance 2.5 le 7 août 2026 avec des durées de 4 à 30 secondes et jusqu'à 30 images de référence, selon le journal des modifications de Runway. Pour le flux de travail narratif de ce guide, une prise unique de 30 secondes avec 50 références élimine une grande partie de l'assemblage de clips décrit ci-dessous.

Disponibilité : API officielle ByteDance (via Volcengine, lancée en février 2026) et fournisseurs API tiers. Sortie en 480p-720p via API, jusqu'à une résolution cinéma 2K via la plateforme.

SpécificationValeur
Durée de clip native4 à 15 secondes
RésolutionJusqu'à 2K (cinéma)
Images de référenceJusqu'à 9 images + 3 vidéos + 3 audio (12 au total)
Durée de clip Seedance 2.5Jusqu'à 30 secondes en natif, avec extensions
Références Seedance 2.5Jusqu'à 30 images + 10 vidéos + 10 audio (50 au total)
AudioNatif avec synchronisation labiale (8+ langues)
APIByteDance/Volcengine, BytePlus ModelArk (2.5), API Runway (2.5), fournisseurs tiers

Runway Gen-4.5 ​

Runway Gen-4.5 a été lancé en tête du classement Text-to-Video d'Artificial Analysis avec 1 247 ELO, devançant à l'époque Veo 3 et Sora 2 Pro. En septembre 2026, l'arène s'était réorganisée (Gemini Omni Flash et Wan 3.0 d'Alibaba se partagent la première place, Gen-4.5 étant sorti du top 10), mais Gen-4.5 reste un modèle solide pour la qualité cinématographique et les actions contrôlables, et Runway n'a pas encore sorti de Gen-5. Le modèle génère des clips de 2 à 10 secondes en text-to-video et prend en charge la vidéo longue à personnage cohérent jusqu'à une minute grâce au séquençage multi-plans.

L'image-to-video a été ajoutée début 2026 et prend en charge les images de référence pour tous les rapports d'aspect. Les autres avancées de Runway en 2026 concernaient l'édition et le routage plutôt qu'un nouveau modèle de base : Aleph 2.0 (2 juin 2026) modifie une vidéo existante de 2 à 30 secondes à partir d'un prompt texte plus jusqu'à 5 images-clés épinglées à des horodatages, Gen-3 Alpha Turbo et le Gen-4 Aleph original ont été retirés de l'API le 30 juillet 2026, et l'API dessert désormais aussi des modèles tiers, dont Gemini Omni Flash et Seedance 2.5, le tout selon le journal des modifications de Runway. Le modèle intègre des champs de radiance neuronale (NeRF) et le splatting gaussien au sein de l'architecture de diffusion, ce qui lui confère une compréhension géométrique 3D plutôt qu'une simple prédiction au niveau des pixels. Cela se traduit par une meilleure permanence des objets et un mouvement physiquement plausible.

Disponibilité : API commerciale et interface web. SDK pour Node et Python. Également disponible sur Replicate.

SpécificationValeur
Durée de clip native2 à 10 secondes
Mode longue duréeJusqu'à ~1 minute
RésolutionJusqu'à 1080p
Images de référence0 à 1 par génération
AudioGénération audio native
Multi-plansOui
APIOui (Runway, Replicate)

Google Veo 3.1 ​

Veo 3.1 de Google génère nativement des clips de 4, 6 ou 8 secondes. La fonctionnalité « Extend Video » (actuellement en aperçu) enchaîne les clips pour atteindre environ 1 à 2,5 minutes, bien que la cohérence puisse se dégrader sur les séquences plus longues.

La fonctionnalité « Ingredients to Video » accepte jusqu'à 3 images de référence en entrée. Vous pouvez fournir des personnages à animer, des arrière-plans et des textures de matériaux. Lorsque vous utilisez des images de référence, le modèle reste plus proche de vos références visuelles et effectue moins de modifications aléatoires. Une limitation : le mode image de référence ne fonctionne qu'avec l'option de durée de 8 secondes.

Depuis janvier 2026, Veo 3.1 a ajouté la vidéo verticale (9:16) pour la génération basée sur des références et l'upscaling 4K sur Vertex AI. Google a ensuite lancé Veo 3.1 Lite le 31 mars 2026 comme son modèle vidéo le moins cher, a retiré Veo 2.0 et 3.0 le 30 juin 2026, et n'a annoncé aucun Veo 4 en date de septembre 2026, selon le journal des modifications de l'API Gemini. Ses travaux vidéo les plus récents sont désormais intégrés à Gemini Omni Flash, ci-dessous.

Disponibilité : API Google Vertex AI, API Gemini et Google Flow. Nécessite un compte Google Cloud.

SpécificationValeur
Durée de clip native4, 6 ou 8 secondes
Durée étendue~1 à 2,5 minutes
RésolutionJusqu'à 4K (avec upscaling)
Images de référenceJusqu'à 3 (« Ingredients to Video »)
AudioDialogue et musique synchronisés
APIVertex AI, API Gemini

Google Gemini Omni Flash ​

Google a annoncé la famille Gemini Omni lors de l'I/O en mai 2026 et a livré Gemini Omni Flash comme son premier modèle. Il a rapidement pris la tête de l'arène Artificial Analysis, devant Veo 3.1. L'argument de vente est la vidéo conversationnelle : vous générez un clip de 10 secondes à partir de texte, d'images ou de vidéo, puis vous l'éditez via des instructions successives qui s'appuient les unes sur les autres. Changez l'éclairage, remplacez une tenue, ajustez la caméra, le tout sans régénérer depuis le début.

Pour la prise en charge des références, Omni Flash accepte des images et de courts clips vidéo comme références de style, de mouvement et d'effet, avec des références audio prévues. La cohérence des personnages tient bon lors des éditions conversationnelles, bien que la documentation même de Google note qu'elle peut se dégrader lors des changements de scène et des mouvements panoramiques de caméra, il convient donc de vérifier les rendus riches en personnages avant de les publier.

Disponibilité : L'API (gemini-omni-flash-preview) a ouvert en aperçu public le 30 juin 2026 via Google AI Studio et l'API Gemini, à environ $0,10 par seconde de sortie, et gemini-omni-1.1-flash a atteint la disponibilité générale le 27 août 2026 avec extension vidéo, interpolation et contrôles de résolution, selon le journal des modifications de l'API Gemini. Chaque clip porte un filigrane SynthID. L'accès grand public passe par l'application Gemini, Google Flow et YouTube Shorts, et l'API de Runway y achemine également.

SpécificationValeur
Durée de clip native10 secondes (durées plus longues prévues)
Résolution720p
Entrées de référenceImages + courts clips vidéo (audio prévu)
ÉditionConversationnelle, itérative
AudioNatif
APIAPI Gemini (GA sous le nom gemini-omni-1.1-flash), ~$0,10/sec

OpenAI Sora 2 / Sora 2 Pro ​

En cours d'abandon (2026) : OpenAI met fin à Sora. L'application grand public Sora a fermé le 26 avril 2026, et l'API Sora 2 sera désactivée le 24 septembre 2026, sans successeur annoncé, selon la page des dépréciations d'OpenAI. Les fonctionnalités ci-dessous restent notables, mais ne construisez pas un nouveau pipeline sur Sora. Utilisez plutôt Kling, Grok Imagine, ou un modèle ouvert.

Sora 2 Pro génère des clips allant jusqu'à 20 secondes. L'API Characters utilise une approche différente de celle de Kling ou Grok : au lieu de téléverser des images statiques, vous créez un character_id en pointant l'API vers un clip vidéo (avec une plage d'horodatage de 1 à 3 secondes). Sora analyse les images de la vidéo pour extraire la structure du visage, les proportions du corps, le style vestimentaire et d'autres caractéristiques d'identification. Ce character_id persiste indéfiniment et peut être réutilisé sur un nombre illimité de générations futures.

Vous pouvez référencer jusqu'à 2 personnages téléversés par génération. Depuis mars 2026, les références de personnage fonctionnent aussi pour les objets et les animaux, pas seulement pour les personnes. L'extension vidéo utilise le clip initial complet comme contexte pour la continuation.

Le système de personnages nécessite une entrée vidéo (et non des images statiques) pour créer des personnages. Si vous n'avez que des photos, vous devrez d'abord générer une courte vidéo, puis en extraire le personnage.

Disponibilité : API OpenAI avec prise en charge de l'API Batch pour les flux de travail en production.

SpécificationValeur
Durée de clip nativeJusqu'à 20 secondes
RésolutionJusqu'à 1920x1080
Références de personnageJusqu'à 2 par génération (character_id persistant)
Entrée de personnageClip vidéo (plage d'horodatage de 1 à 3 s), pas d'images statiques
AudioSynchronisé
ExtensionOui (clip complet comme contexte)
APIAPI OpenAI + API Batch

MiniMax Hailuo 02 ​

Hailuo 02 s'est classé n°2 mondial sur le benchmark Artificial Analysis à son lancement, devançant Veo 3. Il génère des clips de 10 secondes en 1080p natif avec l'une des meilleures simulations physiques du domaine. Le modèle gère les mouvements extrêmes comme la gymnastique et l'acrobatie sans se déformer.

Il prend en charge la génération image-to-video avec une forte cohérence des personnages grâce à la reconnaissance faciale et au suivi corporel. L'architecture Noise-aware Compute Redistribution alloue dynamiquement la puissance de calcul en fonction de la complexité de la scène.

MiniMax a depuis dépassé Hailuo 02 avec la famille Hailuo 2.3 (Standard, Pro, Fast, Fast Pro), qui améliore l'action physique, la stylisation et les micro-expressions des personnages. Elle produit du 1080p à 6 secondes ou du 768p à 10 secondes et est disponible via la plateforme MiniMax et fal.ai.

Disponibilité : API commerciale. Disponible via la plateforme MiniMax, fal.ai et Replicate. 0,28 $ par vidéo.

SpécificationValeur
Durée de clip nativeJusqu'à 10 secondes
Résolution1080p natif
Images de référenceOui (mode I2V)
AudioNon natif
PhysiqueSimulation de premier ordre
APIMiniMax, fal.ai, Replicate

MiniMax H3 (Hailuo 3.0) ​

MiniMax a remplacé la gamme Hailuo 2.x par MiniMax H3 le 31 juillet 2026, ce qui change la place de Hailuo dans ce guide. Là où Hailuo 02 était un modèle première-image, H3 est un modèle omni-modal : un seul transformer lit ensemble le texte, les images, la vidéo et l'audio et renvoie un clip de 4 à 15 secondes jusqu'à 2K avec audio stéréo natif, selon l'annonce de MiniMax. Son mode référence (Ref2VA) accepte jusqu'à 9 images de référence, 3 clips vidéo de référence et 3 clips audio, plafonné à 12 fichiers, ce qui le place dans la même classe de véritable référence que Kling et Seedance 2.0, et un mode première-et-dernière-image (FL2VA) couvre le flux de travail classique par images-clés. Sur l'arène text-to-video d'Artificial Analysis, les entrées H3 et H3 Max se situent juste derrière Omni Flash et Wan 3.0 en date de septembre 2026. La grande nouvelle pour les hébergeurs autonomes, c'est que MiniMax a publié les poids de base 33B en août 2026 sur Hugging Face, avec des checkpoints FL2VA et Ref2VA. La licence est la MiniMax H3 Community License, et la fiche du modèle demande aux utilisateurs des États-Unis, de l'UE, du Royaume-Uni et de la Corée du Sud de soumettre un formulaire de candidature avant utilisation, donc c'est ouvert avec un astérisque régional plutôt qu'ouvert façon Apache.

Disponibilité : API et plateforme MiniMax, fal.ai et autres hébergeurs, ainsi que des poids téléchargeables.

SpécificationValeur
Durée de clip native4 à 15 secondes
RésolutionJusqu'à 2K (768p par défaut sur le petit côté)
Images de référenceJusqu'à 9 images + 3 vidéos + 3 audios (12 au total, Ref2VA)
Images clésPremière et/ou dernière image (FL2VA)
AudioStéréo native, 32 kHz
Poids ouvertsOui, 33B, MiniMax H3 Community License (candidature pour USA/UE/UK/KR)
APIMiniMax, fal.ai

Luma Ray3.2 ​

Le Ray2 de Luma a été remplacé par la famille Ray3. Ray3 (septembre 2025) a ajouté Character Reference pour le verrouillage d'identité et un mode Modify vidéo-vers-vidéo, et Ray3.2 (9 juin 2026) a ajouté un contrôle image par image avec jusqu'à 16 images clés par clip, une fonction Reframe, et des clips allant jusqu'à 20 secondes, plus la première API publique pour la lignée Ray3. La sortie est en 1080p natif avec le 4K disponible via l'upscale Hi-Fi. L'image-vers-vidéo accepte les images de référence comme images clés de début ou de fin.

Disponibilité : API Luma et interface web.

SpécificationValeur
Durée de clip nativeJusqu'à 20 secondes (Ray3.2)
Type de référenceImages clés début/fin + Character Reference (identité)
Résolution1080p natif, 4K via upscale
Images de référenceOui (images clés + référence de personnage)
APIAPI Luma

Pika 2.5 ​

Pika adopte une approche basée sur des images clés avec Pikaframes. Téléchargez 2 à 5 images clés (images de référence à des moments clés) et le modèle génère des transitions fluides entre elles. La durée totale atteint 20 à 25 secondes.

Pikascenes accepte jusqu'à 10 images de référence et les combine en une seule vidéo. Le modèle utilise la reconnaissance d'image pour déterminer automatiquement le rôle de chaque référence (personnage, arrière-plan, accessoire).

Disponibilité : Plateforme web et API Pika. Formules d'abonnement du gratuit au Pro.

SpécificationValeur
Durée de clip native5 à 10 secondes
Durée Pikaframes20 à 25 secondes
RésolutionJusqu'à 1080p
Images de référenceJusqu'à 10 (Pikascenes), 2 à 5 images clés (Pikaframes)
APIOui

Vidu Q3 (ShengShu) ​

Vidu mérite une section qu'elle n'avait pas dans les versions précédentes de ce guide, car sa ligne Q3 est devenue l'un des systèmes de référence de sujet les plus solides disponibles. ShengShu a lancé Vidu Q3 plus tôt en 2026 avec audio natif et des clips allant jusqu'à 16 secondes, et le 13 avril 2026 a ajouté Q3 Reference-to-Video, selon son annonce de lancement. Le mode référence combine sujets, environnements, costumes, accessoires et styles visuels en une seule requête. Selon la documentation de l'API Vidu, le point de terminaison reference2video accepte jusqu'à 7 images de référence, que vous étiquetez dans le prompt sous la forme @1, @2, etc. (« @1 et @2 cuisinent ensemble »), les durées vont de 3 à 16 secondes sur viduq3, la résolution atteint 1080p, et la génération audio est une option activable. Le modèle effectue aussi un changement de caméra intelligent au sein d'un même clip, ce qui est inhabituel et utile pour les scènes de dialogue. ShengShu affirme que Q3 a dominé le premier classement Reference-to-Video de SuperCLUE, et Vidu était déjà le modèle qui avait dépassé Veo sur VBench 2.0 à l'époque où nous avons rédigé la première version de ce guide.

Disponibilité : Application web et API Vidu (viduq3, viduq3-turbo), plus Alibaba Cloud Model Studio et hébergeurs tiers.

SpécificationValeur
Durée de clip native3 à 16 secondes
RésolutionJusqu'à 1080p
Images de référenceJusqu'à 7 (balises @1, @2)
Types de référenceSujets, environnements, accessoires, costumes, styles
AudioNatif (effets sonores, dialogue, musique)
APIAPI Vidu, Alibaba Cloud Model Studio

Niveau 3 : Modèles open source pour flux auto-hébergés ​

Ces modèles génèrent des clips plus courts, mais ils sont entièrement ouverts. Vous pouvez les exécuter sur votre propre matériel, les affiner et construire des pipelines d'extension personnalisés sans dépendance à une API.

Wan 2.1 (Alibaba) ​

Wan 2.1 est la base sur laquelle plusieurs autres modèles s'appuient (y compris Helios). L'architecture Wan-VAE encode et décode de la vidéo en 1080p de n'importe quelle longueur tout en préservant l'information temporelle. Le modèle existe en variantes I2V à 480p et 720p, plus un modèle First-Last-Frame-to-Video qui génère de la vidéo entre deux images de référence.

Wan-Edit permet le transfert de style et de contenu à l'aide d'images de référence tout en maintenant des structures ou poses de personnages spécifiques. Wan 2.2 (juillet 2025) est la version ouverte la plus récente, un modèle Mixture-of-Experts avec une variante 5B qui tourne sur une seule RTX 4090, toujours sous Apache 2.0. Une mise en garde importante pour les hébergeurs autonomes : Wan est devenu fermé à partir de la version 2.5. Les nouveaux Wan 2.5, 2.6, 2.7, et maintenant Wan 3.0, ont ajouté un audio synchronisé et une résolution plus élevée, mais sont uniquement accessibles par API sans poids publics, donc 2.2 reste le plafond ouvert. Wan 3.0 est arrivé en août 2026 sur Alibaba Cloud Model Studio et, selon sa fiche modèle, génère jusqu'à 30 secondes en une seule prise à 480p, 720p ou 1080p à partir de texte, image, vidéo et références audio, et partage le sommet de l'arène text-to-video d'Artificial Analysis avec Gemini Omni Flash en date de septembre 2026. C'est un produit hébergé, pas un téléchargement. Ignorez les pages orientées SEO prétendant que les poids de Wan 2.7 ou 3.0 sont téléchargeables. L'organisation GitHub officielle et le compte Hugging Face plafonnent à 2.2 (les uploads les plus récents sont des rafraîchissements Wan2.2-Animate).

SpécificationValeur
Paramètres1,3B, 5B, 14B (2.1) ; 5B + 14B MoE (2.2)
Modes I2VI2V-480P, I2V-720P, FLF2V-720P
Plafond ouvertWan 2.2 (2.5 à 3.0 sont uniquement en API)
LicenceApache 2.0
Matériel8 Go+ de VRAM (variantes plus petites)
PlateformesDiffusers, ComfyUI

HunyuanVideo (Tencent) ​

Le modèle 13B paramètres de Tencent a été le leader de la génération vidéo open source pendant la majeure partie de 2025. HunyuanVideo-I2V utilise une technique de remplacement de tokens avec un MLLM pré-entraîné pour intégrer les informations de l'image de référence. HunyuanVideo-1.5, publié en novembre 2025, a amélioré l'efficacité. HunyuanCustom permet une génération vidéo personnalisée pilotée par plusieurs modalités.

SpécificationValeur
Paramètres13B
I2VOui (technique de remplacement de tokens)
LicenceOpen source
Matériel60 Go+ de VRAM (720p)
VariantesBase, I2V, 1.5, Avatar, Custom

LTX-2 (Lightricks) ​

Lightricks a rendu LTX-2 open source en janvier 2026, avec les poids complets, le code d'inférence et le code d'entraînement. C'est un modèle basé sur DiT qui génère vidéo et audio synchronisé ensemble en une seule passe, en 4K natif et jusqu'à 50 ips, avec des clips allant jusqu'à 20 secondes. L'image-vers-vidéo et le conditionnement multi-images clés sont intégrés, donc vous pouvez épingler des images fixes de référence à des points le long du clip, comme avec Pikaframes.

La licence est la contrainte, ou ne l'est pas, selon votre taille. LTX-2 est gratuit pour la recherche et pour un usage commercial en dessous de 10 M$ de chiffre d'affaires annuel. Au-delà, il faut une licence commerciale, donc c'est plutôt des poids ouverts qu'un open source au sens strict. LTX-2.3 était une mise à jour de 22B paramètres avec un meilleur audio et une meilleure adhérence au prompt, et LTX-2.5, le checkpoint actuel en date de septembre 2026, conserve la taille de 22B et ajoute une génération multishot native qui conserve un même personnage et un même style sur plusieurs plans connectés, un décodeur vidéo par diffusion à la place d'une simple reconstruction VAE, et un encodeur de texte Gemma 4 12B pour les prompts longs, toujours sous la LTX-2.x Community License avec la même limite de 10 M$ de chiffre d'affaires. Les poids sont sur Hugging Face avec des variantes distillées, des adaptateurs LoRA, et des intégrations ComfyUI et Diffusers, et des API hébergées tournent sur la plateforme LTX, fal.ai et Replicate.

SpécificationValeur
Paramètres22B (LTX-2.3 et LTX-2.5)
Clip max~20 secondes
Résolution4K natif jusqu'à 50 ips
AudioSynchronisé natif
I2VOui (conditionnement par image + multi-images clés)
LicenceLTX-2 Community License (gratuit sous 10 M$ de CA annuel)
MatérielVariantes distillées et FP8 pour GPU grand public

CogVideoX (Tsinghua/Zhipu AI) ​

CogVideoX utilise un VAE causal 3D qui réduit la longueur de séquence et empêche le scintillement. Le transformer à LayerNorm adaptatif améliore l'alignement texte-vidéo. Disponible en variantes 2B (Apache 2.0) et 5B (licence de recherche) avec intégration native Diffusers.

Les clips durent 6 à 10 secondes en 720x480. Court, mais le rapport qualité/calcul est bon et le modèle tourne sur un GPU de 12 Go.

SpécificationValeur
Paramètres2B, 5B
I2VOui (CogVideoXImageToVideoPipeline)
Résolution720x480 à 8 ips
LicenceApache 2.0 (2B), Recherche (5B)
Matériel12 Go de VRAM

Première image contre vraie référence : la distinction clé ​

Tous les supports d'« image de référence » ne se valent pas. Comprendre la différence est essentiel pour choisir le bon modèle.

Les modèles à première image (LongCat, Helios, Hailuo, Luma Ray2, HunyuanVideo) traitent votre image comme la première image littérale de la vidéo. Le modèle anime à partir de ce visuel exact. Vous ne pouvez pas télécharger un portrait de personnage et le décrire dans une scène différente. L'image, c'est la scène.

Les modèles à vraie référence (Kling, Grok Imagine, Seedance, Vidu Q3, MiniMax H3, SkyReels V3) extraient l'identité de votre image et placent ce personnage/objet dans n'importe quelle scène que vous décrivez. Téléchargez la photo d'une personne, puis demandez que « cette personne traverse une forêt au coucher du soleil ». Le personnage apparaît dans un environnement entièrement nouveau tout en conservant son identité. C'est ce dont vous avez besoin pour du contenu narratif multi-scènes, comme un film d'aventure.

Les modèles à ID de personnage (Sora 2 Pro) extraient l'identité à partir de clips vidéo plutôt que d'images statiques. Vous créez un ID de personnage persistant une seule fois et le réutilisez à travers un nombre illimité de générations futures.

Les modèles de style/ingrédients (Veo 3.1) utilisent des images de référence pour influencer le style visuel, les textures et l'apparence générale plutôt que d'extraire des identités de personnages précises. Utile pour maintenir une cohérence visuelle sur l'ensemble d'un projet, moins précis pour le contrôle individuel des personnages.

Le vrai flux de travail pour des vidéos de 10 minutes ​

Voici le constat honnête sur la situation à la mi-2026. Aucun modèle unique ne génère de manière fiable 10 minutes de vidéo cohérente et de haute qualité en une seule prise. LongCat Video s'en approche le plus avec des annonces de 15 minutes, mais la qualité et la cohérence varient considérablement sur ces durées. Helios et SkyReels V2 génèrent respectivement de la vidéo « à l'échelle de la minute » et « de longueur infinie », mais les résultats nécessitent un prompt soigné et souvent plusieurs tentatives.

Le flux de travail qui fonctionne réellement pour la plupart des créateurs produisant des vidéos de 5 à 15 minutes combine plusieurs approches :

Pour le contenu type tête parlante / avatar : le mode piloté par audio de LongCat Video en 2026 ou la génération d'avatars de SkyReels V3 peuvent produire 5 minutes ou plus d'un personnage parlant cohérent. C'est ce qui se rapproche le plus de « appuyez sur un bouton, obtenez une vidéo longue ».

Pour le contenu narratif multi-scènes (style film d'aventure) : utilisez Kling 3.0, Grok Imagine ou Seedance 2.0 avec de vraies images de référence de personnage. Générez des plans individuels de 10 à 15 secondes chacun. Utilisez les mêmes références @Element ou <IMAGE> sur chaque génération pour maintenir l'identité du personnage. Enchaînez les plans à l'aide du mode multi-plans (Kling prend en charge 6 plans par appel) ou de l'API d'extension. Kling est le plus éprouvé pour ce flux de travail. La séparation explicite de Grok Imagine entre « mode référence » et « mode première image » en fait une alternative solide. Seedance 2.5 accepte désormais le plus grand nombre d'entrées de référence (50 fichiers) et génère des prises de 30 secondes, ce qui réduit d'environ moitié le nombre de raccords nécessaires, et Vidu Q3 (7 références avec balises @) et MiniMax H3 (12 fichiers) sont des options récentes crédibles.

Pour la cohérence des personnages sur de nombreux clips : le système d'character_id persistant de Sora 2 Pro est l'approche la plus propre pour les projets très longs. Extrayez le personnage une fois à partir d'une courte vidéo, puis générez des dizaines de clips faisant référence à cet ID. L'identité du personnage ne se dégrade pas avec le temps car elle est stockée sous forme d'embedding persistant, et non réinterprétée à partir d'une image à chaque fois.

Pour le contenu à transfert de style : Lucy Restyle sur fal.ai traite des vidéos existantes jusqu'à 30 minutes, en appliquant des transformations de style par IA tout en préservant le mouvement. Si vous disposez de séquences sources, cela contourne entièrement le problème de la longueur de génération. 0,01 $ par seconde de vidéo source.

Pour les pipelines open source : construisez sur Wan 2.2 ou Helios avec une boucle de continuation vidéo, ou sur le checkpoint Ref2VA de MiniMax H3 si sa licence communautaire convient à votre région, puisque c'est le premier modèle ouvert avec un mode de référence à 9 images. Générez un clip, utilisez la dernière image comme image de départ pour le clip suivant, répétez. Les flux ComfyUI automatisent cela. La cohérence se dégrade sur de nombreuses itérations mais c'est gratuit et contrôlable.

Le défi central demeure : même avec un vrai support d'image de référence, la dérive des personnages s'accumule sur des dizaines de clips. Les traits du visage, les cheveux, les vêtements et le teint dérivent progressivement. Les solutions de contournement (photos de référence de haute qualité, prompts cohérents, traitement par lots des plans) sont nécessaires. Mais des modèles comme Kling et Grok Imagine, qui séparent l'identité du personnage de la composition de la scène, rendent cela considérablement plus facile que les modèles à première image uniquement.

L'approche de l'échafaudage 3D : rendu basse fidélité, transformation haute fidélité ​

Il existe un flux de travail qui gagne en popularité et contourne presque entièrement les problèmes de génération longue durée. Plutôt que de demander à un modèle IA de générer 10 minutes de vidéo à partir de rien, vous effectuez le rendu d'une cinématique 3D basse fidélité avec un travail de caméra, un blocage des personnages et un minutage corrects, puis vous la faites passer par un modèle vidéo-vers-vidéo avec des images de référence et un prompt d'amélioration. Le moteur 3D gère la structure. L'IA gère l'esthétique. Cela fonctionne parce que la transformation V2V est un problème plus restreint que la génération complète. Le modèle n'a pas besoin d'inventer un mouvement de caméra, un placement de personnage ou une composition de scène. Il doit simplement rendre les images existantes photoréalistes tout en suivant vos références visuelles. C'est bien plus faisable, et cela s'adapte à n'importe quelle durée que votre moteur 3D peut restituer.

Pourquoi ça fonctionne ​

Votre moteur 3D vous donne tout ce avec quoi les modèles vidéo IA peinent encore : un contrôle précis de la caméra, un placement exact des personnages dans le cadre, des interactions physiques correctes, et une cohérence temporelle sur plusieurs minutes de séquence. Les zooms travellings, les plans de suivi, les personnages entrant et sortant du cadre au bon moment, tout cela est trivial dans un moteur 3D, et tout cela est peu fiable dans la génération par texte. La seule tâche du modèle V2V est de transformer les matériaux, l'éclairage et les textures en résultat photoréaliste tout en préservant la géométrie et le mouvement que vous avez déjà définis.

La cohérence des personnages devient également plus simple. Au lieu de lutter contre la dérive d'identité sur 50 générations IA distinctes, vous montrez au modèle le même personnage 3D dans chaque image. Les images de référence indiquent au modèle à quoi ce personnage doit ressembler dans le résultat final. C'est un problème plus simple que de générer un personnage cohérent à partir de zéro à chaque fois.

Et la durée n'est plus une contrainte. Lucy Restyle gère 30 minutes en un seul appel. Wan 2.1 dans ComfyUI peut traiter n'importe quelle durée par blocs. Vous ne luttez plus du tout contre le problème « comment générer 10 minutes » puisque les images existent déjà.

RealMaster (Meta / Université de Tel Aviv) ​

RealMaster est un système de recherche construit spécifiquement pour ce flux de travail. Publié en mars 2026 par Meta Reality Labs et l'Université de Tel Aviv, il transforme une vidéo 3D rendue en vidéo photoréaliste tout en maintenant un alignement géométrique complet avec la source.

La méthode extrait des cartes de contours du rendu 3D pour préserver la structure et le mouvement, puis applique un modèle de diffusion vidéo (construit sur l'architecture VACE/Wan) pour transformer tout le reste en résultat photoréaliste. Un adaptateur IC-LoRA léger distille le pipeline en une seule passe d'inférence qui n'a pas besoin d'images d'ancrage et gère les objets apparaissant en cours de séquence.

Testé sur des séquences des simulateurs GTA-V et CARLA, RealMaster surpasse nettement les références générales d'édition vidéo. Il peut également superposer des effets météorologiques via l'invite textuelle (« Fais pleuvoir », « Fais neiger ») en plus de la transformation de réalisme. Le modèle se généralise à travers les simulateurs sans réentraînement. Les poids entraînés sur des données GTA-V fonctionnent sur des sorties CARLA sans réglage supplémentaire.

Disponibilité : recherche uniquement. Pas encore de poids publics ni d'API.

CaractéristiqueValeur
EntréeVidéo 3D rendue (n'importe quel moteur)
SortieVidéo photoréaliste préservant la géométrie et le mouvement
ArchitectureIC-LoRA sur backbone de diffusion vidéo VACE/Wan
ConditionnementCartes de contours issues du rendu source
Testé surSimulateurs GTA-V, CARLA
LicenceNon publiée (article de recherche uniquement)

Outils V2V de production disponibles aujourd'hui ​

Kling 3.0 V2V avec références d'éléments est l'option de production la plus complète. Les points d'accès Edit Video et Reference V2V sur fal.ai acceptent des clips vidéo source de 3 à 10 secondes accompagnés de références d'éléments (@Element1, @Element2 avec photos frontales et multi-angles) et d'une invite d'amélioration. Le modèle analyse les trajectoires de mouvement et les schémas de caméra dans la source, puis régénère les images avec les apparences de personnages et le style visuel que vous avez spécifiés, tout en préservant la mise en scène et le travail de caméra d'origine. Jusqu'à 7 entrées de référence. Sortie en 1080p. Traitez votre cutscene en blocs de 10 à 15 secondes en utilisant les mêmes références d'éléments sur tous les blocs pour maintenir la cohérence des personnages.

Lucy Restyle 2 gère jusqu'à 30 minutes de vidéo source en un seul appel API pour 0,01 $ par seconde d'entrée. Il accepte une invite textuelle et une image de référence optionnelle pour guider le style. Pas de références d'éléments par personnage comme Kling, mais pour un transfert de style cinématographique global d'un rendu 3D complet, c'est le chemin le plus simple et le moins cher. Fournissez-lui votre rendu complet et une invite décrivant le rendu visuel cible. Sortie en 720p avec cohérence temporelle sur des milliers d'images.

Wan 2.1 VACE dans ComfyUI est la voie open source. Le modèle VACE 14B effectue du V2V guidé par référence : en entrée une vidéo source plus une image de référence de style, en sortie une version restylée qui préserve la structure et le mouvement. Le conditionnement par carte de contours améliore la fidélité structurelle. Vous pouvez construire une boucle de traitement qui gère n'importe quelle durée par blocs avec des références de style cohérentes. Gratuit, s'exécute localement sur votre propre matériel.

Grok Imagine V2V accepte une vidéo source plus 1 à 7 images de référence en mode référence. 0,05 $ par seconde en 720p. La séparation explicite entre le mode référence et le mode première-image signifie que vos références guident l'apparence des personnages sans écraser la structure de la vidéo source.

Ce dont votre rendu 3D a besoin ​

Le seuil de qualité de rendu compte. Un simple fil de fer ne donnera pas assez de matière au modèle V2V pour travailler. Mais vous n'avez pas non plus besoin de matériaux ou d'éclairage de qualité production.

Proportions et géométrie correctes. Les modèles de personnages ont besoin de proportions corporelles et d'une structure faciale à peu près correctes pour que les images de référence puissent se projeter correctement. Une géométrie humanoïde basique avec des proportions correctes suffit. Un bonhomme allumette ne produira pas de personnage reconnaissable.

Direction d'éclairage basique. Une simple lumière directionnelle établissant l'éclairage global de la scène aide le modèle à comprendre l'ambiance visée. L'IA améliorera et ajoutera des détails, mais elle doit savoir si la scène est en plein jour ou dans un intérieur sombre.

Mouvement de caméra fluide. Les mouvements de caméra stables et délibérés se traduisent bien. Un mouvement erratique ou extrêmement rapide peut perturber les modèles V2V. Faites en sorte que votre caméra virtuelle se comporte comme une vraie caméra.

Ombrage plat plutôt que fil de fer. Une géométrie simple à ombrage plat ou low-poly donne de meilleurs résultats que des modèles en fil de fer ou sans texture. Même des couleurs unies basiques sur les surfaces aident le modèle à comprendre les limites des matériaux.

Coût et échelle ​

Traitement d'une cutscene de 10 minutes via différents outils :

OutilDurée d'entrée maxCoût pour 10 minRésolutionImages de référence
Kling O3 V2VClips de 10s~50-67 $1080pJusqu'à 7 (éléments + style)
Lucy Restyle 230 minutes6 $720p1 (style uniquement)
Grok Imagine V2VClips de 10s~30 $720p1-7
Wan 2.1 VACEN'importe laquelle (par blocs)Gratuit (GPU local)720p1 par bloc

Ces chiffres sont nos estimations basées sur les prix catalogue des fournisseurs au moment où nous avons réalisé cette comparaison mi-2026, et les fournisseurs révisent souvent leurs prix ; considérez-les donc comme un classement relatif plutôt qu'un devis. Lucy Restyle est le moins cher pour un traitement pleine durée. Kling est le plus précis pour l'amélioration spécifique aux personnages avec des références d'éléments. Wan 2.1 est gratuit si vous avez le matériel (nécessite environ 60 Go de VRAM pour le modèle 14B en 720p, ou 8 Go pour la variante 1.3B à qualité inférieure).

Tableau comparatif ​

ModèleDurée native maxDurée étendueType de référenceRéf. maxRésolutionAPI disponibleOpen Source
LongCat Video~15 minN/APremière image uniquement1720p/30fpsOui (fal.ai)Oui (MIT)
Seaweed APT2~5 minN/AI2V + pose1720pNonNon
HeliosÉchelle de la minuteN/APremière image (I2V)1720pHF SpacesOui (Apache 2.0)
SkyReels V3IllimitéeN/AVraie référence1-4720pNonOui
Kling 3.015s~3 minÉléments + réf. de style71080pOuiNon
Grok Imagine15sEnchaînableVraie référence7720pOuiNon
Seedance 2.015sN/ARéf. multimodales122KOuiNon
Seedance 2.530sExtension multi-rondesRéf. multimodales502KOui (BytePlus, Runway)Non
Vidu Q316sN/AVraie référence71080pOuiNon
MiniMax H315sN/ARéf. multimodales122KOuiOui (licence communautaire)
Runway Gen-4.510s~1 minI2V (0-1)11080pOuiNon
Veo 3.18s~2,5 minIngredients (style)34KOuiNon
Gemini Omni Flash10sÉdition conversationnelle + extension (1.1)Réf. multimodalesImages + vidéo720pOui (GA)Non
Sora 2 Pro ⚠️ en cours d'arrêt20sEnchaînableID de personnage (vidéo)21080pAPI désactivée en sept. 2026Non
Hailuo 0210sN/AI2V (première image)11080pOuiNon
Luma Ray3.220sN/AImages clés + réf. de personnage16 images clés1080p (upscale 4K)OuiNon
Pika 2.510s25sPikascenes101080pOuiNon
Wan 2.1 / 2.2Clips courtsVia continuationI2V / FLF2V1-2720pVia fal.aiOui (Apache 2.0)
Wan 3.030sN/ARéf. multimodalesImages, vidéo, audio1080pOui (Alibaba Cloud)Non
HunyuanVideoClips courtsVia continuationI2V (première image)1720pVia fal.aiOui
LTX-2.320sVia continuationI2V + images clésMulti-images clés4KOui (LTX, fal.ai)Poids (ARR plafonné)
CogVideoX6-10sVia continuationI2V (première image)1720x480Via fal.aiOui

Ce qui s'en vient ​

La trajectoire à travers 2026 est claire. LongCat Video a prouvé que la génération à l'échelle de la minute avec cohérence est possible dans un modèle ouvert. Helios a montré que cela peut se faire en temps réel. Seaweed APT2 a démontré une génération longue durée interactive. Et les modèles à vraie référence (Kling, Grok, Seedance) ont prouvé que l'identité des personnages peut persister à travers des scènes arbitraires.

La prochaine étape consiste à combiner ces capacités : génération native longue durée avec véritable prise en charge des références de personnages. Actuellement, vous devez choisir l'un ou l'autre. Quand un modèle pourra générer 5 minutes de vidéo tout en maintenant les personnages à partir d'images de référence à travers des dizaines de changements de scène, le flux de travail par clips enchaînés deviendra obsolète. Seedance 2.5 (clips natifs de 30 secondes, jusqu'à 50 fichiers de référence, sorti le 31 juillet 2026) et Wan 3.0 (prises uniques de 30 secondes à partir de références multimodales, août 2026) sont les premiers vrais pas dans cette direction.

Début septembre 2026, l'arène text-to-video d'Artificial Analysis (avec audio) place Gemini Omni Flash de Google et Wan 3.0 d'Alibaba (API uniquement) à égalité en tête (~1 239 Elo), avec MiniMax H3 Max et H3 quelques points derrière, puis Seedance 2.0, Wan 2.7, les modèles HappyHorse, l'aperçu MAGI-2 de Sand.ai, et Kling 3.0 Pro complétant le top dix. Le classement se réorganise fréquemment, considérez donc tout classement ponctuel comme une photographie plutôt qu'un ordre fixe.

L'approche du gabarit 3D offre une trajectoire parallèle. À mesure que les modèles V2V améliorent leur préservation structurelle et leur photoréalisme, l'amélioration de rendus 3D basse fidélité devient de plus en plus viable pour une production complète. RealMaster de Meta atteint déjà une qualité recherche pour la transformation sim-vers-réel sur des sorties de moteur de jeu. Quand cette capacité arrivera dans des API de production avec prise en charge des images de référence, quiconque possède des compétences 3D de base pourra produire de la vidéo photoréaliste longue durée avec un contrôle complet de la caméra, de la mise en scène et du placement des personnages, quelle que soit la durée.

Pour l'instant, la réponse pratique dépend de votre cas d'usage :

Meilleur pour la référence multi-personnages : Kling 3.0 (jusqu'à 7 réf. avec système séparé éléments + style), Seedance 2.5 (jusqu'à 50 entrées multimodales dans une prise de 30 secondes), ou Vidu Q3 (7 références étiquetées avec changement de caméra en cours de clip).

Meilleure API pour la référence-vers-vidéo : Grok Imagine (API propre, mode référence explicite, 0,05 $/s pour le modèle original), Vidu Q3 (balises @, 7 réf.), ou Kling via fal.ai.

Meilleur pour des personnages persistants sur de nombreux clips : les références d'éléments de Kling 3.0 ou le système référence-et-extension de SkyReels V3. (Le système d'ID de personnage de Sora 2 Pro était l'approche la plus propre, mais il est en cours d'arrêt en 2026, donc ne commencez pas de nouveau travail dessus.)

Meilleur open source : SkyReels V3 (1 à 4 vraies images de référence, durée illimitée), MiniMax H3 (9 images de référence plus vidéo et audio, licence communautaire avec demande régionale), ou Helios (temps réel, Apache 2.0).

Meilleur pour la durée brute : LongCat Video (~15 min, mais première image uniquement).

Meilleur pour l'amélioration de rendu 3D : Kling 3.0 V2V (réf. d'éléments par personnage, 1080p) ou Lucy Restyle 2 (entrée de 30 min, 0,01 $/s).


Questions fréquentes ​

Quel est le meilleur modèle vidéo IA pour les vidéos longues ? ​

Pour la durée brute, LongCat Video génère environ 15 minutes nativement, bien qu'il soit limité à la première image. Pour une vidéo longue avec des personnages cohérents, la réponse pratique en 2026 est un flux de travail référence-et-extension : générer des clips avec un modèle offrant une bonne prise en charge des références (Kling 3.0, Runway Gen-4.5, ou l'open source SkyReels V3), puis les enchaîner. Aucun modèle unique ne dure longtemps tout en conservant parfaitement l'identité des personnages, c'est pourquoi la plupart des travaux de production combinent les deux.

Quels modèles vidéo IA prennent en charge les images de référence ? ​

Kling 3.0 Omni, Runway Gen-4.5, Seedance 2.0 et 2.5, Vidu Q3, MiniMax H3, Google Veo 3.1, et Gemini Omni Flash prennent tous en charge les images de référence parmi les options commerciales. Côté open source, SkyReels V2/V3, Wan 2.1 et 2.2, LTX-2.5, et les poids ouverts de MiniMax H3 acceptent des entrées de référence que vous pouvez exécuter vous-même. La qualité de la prise en charge varie beaucoup, c'est pourquoi le guide ci-dessus les répartit en niveaux.

L'IA peut-elle générer un personnage cohérent sur une vidéo longue ? ​

Oui, mais pas en une seule fois. L'approche fiable consiste à verrouiller un personnage avec une ou plusieurs images de référence, générer des clips courts, puis les étendre ou les assembler en réinjectant les mêmes références. La véritable prise en charge des références (le modèle conserve l'identité à travers de nouvelles générations) compte bien plus ici que le conditionnement par première image, qui n'initialise que l'image d'ouverture.

Quelle est la différence entre la prise en charge par première image et la véritable prise en charge des images de référence ? ​

Le conditionnement par première image utilise votre image comme véritable image d'ouverture du clip, puis dérive à mesure que la vidéo progresse. La véritable prise en charge de référence traite l'image comme une ancre d'identité que le modèle respecte tout au long de la génération, de sorte qu'un personnage ou un style reste cohérent sur l'ensemble du clip et sur des clips distincts. La section ci-dessus détaille quels modèles font quoi.

Comment fonctionne l'image-vers-vidéo de Kling AI avec plusieurs images de référence ? ​

La référence multi-image de Kling est un mode distinct de l'image-vers-vidéo classique. Au lieu d'animer une seule image comme première frame, vous téléchargez jusqu'à 7 images et éléments (4 si vous joignez aussi une vidéo de référence), vous les tagguez dans le prompt comme @Image1 ou @Element1, et vous décrivez le plan. Les éléments sont des personnages ou objets verrouillés construits à partir d'un maximum de 4 photos sous différents angles ou d'un court clip vidéo, avec éventuellement une voix associée, et ils persistent à travers le storyboard multi-plans de Kling. Les règles complètes se trouvent dans la section Kling ci-dessus, directement issues du guide officiel de Kuaishou.

Qu'en est-il de Wan 2.2 ? Wan 2.5 ou Wan 3.0 sont-ils open source ? ​

Wan 2.2 (juillet 2025) est le Wan le plus récent que vous pouvez télécharger, une version Mixture-of-Experts sous licence Apache 2.0 avec une variante 5B qui tourne sur une seule RTX 4090 et des modèles texte-vers-vidéo et image-vers-vidéo 14B. Wan 2.5, 2.6, 2.7, et Wan 3.0 (août 2026, prises uniques de 30 secondes jusqu'à 1080p) sont uniquement accessibles via API sur Alibaba Cloud, sans poids publics, quoi qu'en disent les blogs d'affiliation. Si vous voulez le workflow d'image de référence sur des poids ouverts, utilisez les modèles image-vers-vidéo et première-dernière-image de Wan 2.2, ou regardez du côté de SkyReels V3 et MiniMax H3.

Quelle est la différence entre image-vers-vidéo et référence-vers-vidéo ? ​

L'image-vers-vidéo anime l'image que vous lui donnez, votre image est donc la frame d'ouverture et le modèle continue à partir de là. La référence-vers-vidéo utilise vos images comme ancres d'identité et de style et génère un nouveau plan à partir de votre prompt, de sorte qu'un personnage photographié en studio peut apparaître en train de marcher dans une forêt. L'image-vers-vidéo convient pour animer une image fixe terminée. La référence-vers-vidéo convient pour des histoires multi-scènes avec un personnage cohérent. Kling, Vidu Q3, Seedance, Grok Imagine, et MiniMax H3 proposent les deux modes, et Vidu et Grok les distinguent explicitement dans leurs API.

Quels modèles d'IA vidéo conservent le même sujet à travers plusieurs clips (référence de sujet) ? ​

Pour la référence de sujet ou de personnage à travers de nombreux clips, les options les plus solides en septembre 2026 sont Kling 3.0 Omni (bibliothèque d'éléments avec photos multi-angles et voix), Seedance 2.5 (jusqu'à 50 références et des prises de 30 secondes), Vidu Q3 (7 sujets tagués), et MiniMax H3 (9 images de référence plus vidéo et audio). Luma Ray3 ajoute une fonction Character Reference et les character IDs de Sora 2 Pro constituaient le système le plus propre, mais l'API de Sora ferme le 24 septembre 2026. Sur les poids ouverts, SkyReels V3 et MiniMax H3 sont ceux qui disposent d'une véritable référence de sujet.


À lire aussi ​

Essayez tout de suiteRendez la scène jouable plutôt que simplement rendue

Passez la file de rendu, traversez-la en direct.

Créer gratuitement →C'est gratuit, ça tourne dans votre navigateur, rien à installer.