Skip to content

रेफ़रेंस इमेज सपोर्ट वाले सर्वश्रेष्ठ AI वीडियो मॉडल (2026)

आखिरी अपडेट: सितंबर 2026.

10 सेकंड की क्लिप बनाना अब आसान है। हर बड़ा मॉडल यह कर लेता है। असली सवाल यह है: क्या आप 5 या 10 मिनट का ऐसा संगत (coherent) वीडियो बना सकते हैं जिसमें एक कैरेक्टर पहले मिनट में और आठवें मिनट में भी एक जैसा दिखे? जहाँ सीन सैकड़ों फ्रेम्स तक आपस में जुड़ा रहे?

यही असली मुश्किल समस्या है। और यहीं चीज़ें तेज़ी से बदल रही हैं। यह गाइड हर उस मॉडल को कवर करती है जो हमें मिला है, चाहे वह नेटिव रूप से लंबा वीडियो जनरेट करता हो या संदर्भ छवियों के ज़रिए संगत कैरेक्टर के साथ लॉन्ग-फॉर्म कंटेंट बनाने के लिए ज़रूरी वर्कफ़्लो सपोर्ट करता हो। हमने इन्हें तीन स्तरों में बाँटा है: वे मॉडल जो सीधे मिनटों-लंबा वीडियो जनरेट करते हैं, वे मॉडल जिनमें मज़बूत संदर्भ छवि सपोर्ट है और जिन्हें आप कंटीन्यूएशन के ज़रिए बढ़ाते हैं, और वे ओपन-सोर्स विकल्प जिन्हें आप खुद चला सकते हैं।

स्तर 1: नेटिव लॉन्ग-फॉर्म जनरेशन (मिनटों में)

ये मॉडल मिनटों में मापा जाने वाला वीडियो जनरेट करते हैं, सेकंडों में नहीं। इन्हें शुरू से ही लंबे सीक्वेंस में टेम्पोरल संगति के लिए बनाया गया है।

LongCat Video

Meituan ने 2025 के अंत में LongCat Video जारी किया। यह 13.6 बिलियन पैरामीटर वाला डिफ्यूज़न ट्रांसफॉर्मर है और यह पहला मॉडल है जो भरोसेमंद तरीके से 15 मिनट तक लंबा संगत वीडियो जनरेट कर सकता है।

यह मॉडल टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, और वीडियो कंटीन्यूएशन को एक ही यूनिफाइड पाइपलाइन में सपोर्ट करता है। I2V मोड में, इनपुट इमेज वीडियो का शाब्दिक पहला फ्रेम बन जाती है। यह किसी भी सीन में रखा जा सकने वाला ढीला-ढाला कैरेक्टर रेफरेंस नहीं है। मॉडल उस शुरुआती फ्रेम से आगे एनिमेट करता है और साथ ही "Cross-Chunk Latent Stitching" का इस्तेमाल करके पूरी जनरेशन के दौरान मूल इमेज का संदर्भ बनाए रखता है, जिससे कलर ड्रिफ्ट रुकता है और लंबे सीक्वेंस में विज़ुअल संगति बनी रहती है। एक अपडेटेड 2026 वेरिएंट में 5+ मिनट की टॉकिंग हेड वीडियो के लिए लिप-सिंक के साथ ऑडियो-ड्रिवन अवतार जनरेशन भी जोड़ा गया है।

अंदरूनी तौर पर, LongCat विशाल सीक्वेंस लंबाई को संभालने के लिए Block Sparse Attention के साथ एक कोर्स-टू-फाइन जनरेशन तरीका इस्तेमाल करता है। RLHF ट्यूनिंग मोशन क्वालिटी को बेहतर बनाती है। VBench 2.0 बेंचमार्क पर यह कुल मिलाकर तीसरे नंबर पर आता है, Google Veo 3 और Shengshu के Vidu Q1 के बाद।

उपलब्धता: MIT लाइसेंस के तहत ओपन सोर्स। fal.ai API के ज़रिए $0.04 प्रति जनरेट किए गए सेकंड पर उपलब्ध (720p पर 15-मिनट की वीडियो के लिए $36)। LongCat के अपने प्लेटफ़ॉर्म पर क्रेडिट-आधारित प्राइसिंग के साथ भी उपलब्ध।

स्पेकमूल्य
अधिकतम अवधि~15 मिनट
रिज़ॉल्यूशन30fps पर 720p
पैरामीटर13.6B
संदर्भ छवियाँकेवल पहला फ्रेम (I2V मोड, कैरेक्टर रेफरेंस नहीं)
लाइसेंसMIT
API लागत~$0.04/सेकंड (fal.ai)

Seaweed APT2

ByteDance का Seaweed APT2 एक अलग तरीका अपनाता है। पूरी वीडियो को पहले से जनरेट करने के बजाय, यह एक ही H100 पर प्रति फ्रेम केवल 0.16 सेकंड लेटेंसी के साथ 24fps पर फ्रेम्स को ऑटोरिग्रेसिव तरीके से बनाता है। नतीजा 5 मिनट तक स्थिर वीडियो होता है जिसकी टेम्पोरल संगति बनी रहती है।

तकनीकी तरकीब है Autoregressive Adversarial Post-Training (AAPT), जो एक प्रीट्रेंड बाइडायरेक्शनल वीडियो डिफ्यूज़न मॉडल को यूनिडायरेक्शनल ऑटोरिग्रेसिव जनरेटर में बदल देती है। हर फ्रेम के लिए सिंगल नेटवर्क फॉरवर्ड एवैल्यूएशन। यही चीज़ रीयल-टाइम जनरेशन को संभव बनाती है।

इस मॉडल को महज़ लंबाई से आगे दिलचस्प बनाने वाली बात है इसका इंटरैक्टिव होना। आप कैमरा को कंट्रोल कर सकते हैं, पोज़ डिटेक्शन के ज़रिए कैरेक्टर्स को एनिमेट कर सकते हैं, और वीडियो रेंडर होते समय सीन में बदलाव कर सकते हैं। इसे "वीडियो जनरेट करना" के बजाय "वीडियो को रीयल-टाइम में स्टीयर करना" समझें तो बेहतर होगा।

उपलब्धता: अभी सिर्फ़ रिसर्च फ़ेज़ में। अभी सार्वजनिक रूप से उपलब्ध नहीं है। 7B बेस मॉडल (Seaweed-7B) का पेपर प्रकाशित है लेकिन APT2 के वेट्स अभी जारी नहीं किए गए हैं।

स्पेकमूल्य
अधिकतम अवधि~5 मिनट
रिज़ॉल्यूशन736x416 (सिंगल GPU), 720p तक (8 GPU)
पैरामीटर8B
संदर्भ छवियाँI2V और इंटरैक्टिव पोज़ कंट्रोल के ज़रिए
लाइसेंसजारी नहीं किया गया
स्थितिरिसर्च प्रीव्यू

Helios

Helios पेकिंग यूनिवर्सिटी से आया है, जो Wan 2.1 पर बना है। यह 14B पैरामीटर वाला मॉडल है जो एक ही H100 पर 19.5 FPS पर मिनट-स्केल वीडियो जनरेट करता है। इसकी मुख्य खासियत है कि यह लॉन्ग-वीडियो ड्रिफ्टिंग को कैसे संभालता है। सेल्फ-फोर्सिंग या कीफ्रेम सैंपलिंग जैसी पारंपरिक एंटी-ड्रिफ्टिंग तकनीकों का इस्तेमाल करने के बजाय, Helios ट्रेनिंग के दौरान ड्रिफ्टिंग की नकल करता है ताकि मॉडल इसे ठीक करना सीख सके।

यह नेटिव रूप से टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, और वीडियो-टू-वीडियो टास्क सपोर्ट करता है। I2V मोड जनरेशन को शुरू करने के लिए संदर्भ छवियाँ स्वीकार करता है।

उपलब्धता: Apache 2.0 के तहत पूरी तरह ओपन सोर्स। मार्च 2026 में जारी। कोड और वेट्स GitHub पर (PKU-YuanGroup/Helios)। Diffusers, SGLang, और vLLM-Omni में एकीकृत। HuggingFace Spaces पर Gradio डेमो।

स्पेकमूल्य
अधिकतम अवधिमिनट-स्केल (कोई तय सीमा नहीं)
रिज़ॉल्यूशन720p
पैरामीटर14B
संदर्भ छवियाँहाँ (I2V मोड)
लाइसेंसApache 2.0
हार्डवेयररीयल-टाइम के लिए सिंगल H100

SkyReels V2 / V3

SkyReels V3, 1-4 संदर्भ छवियाँ स्वीकार करता है और मल्टी-शॉट स्विचिंग तथा ऑडियो-गाइडेड अवतार सिंथेसिस के साथ असीमित-लंबाई का वीडियो जनरेट करता है।

Skywork की SkyReels सीरीज़ का लक्ष्य असीमित-लंबाई का वीडियो है। V2, एक AutoRegressive Diffusion-Forcing आर्किटेक्चर इस्तेमाल करता है जो बिना किसी तय अवधि की सीमा के वीडियो जनरेट करता है। V3, जो जनवरी 2026 में जारी हुआ, संदर्भ इमेज-टू-वीडियो, वीडियो-टू-वीडियो एक्सटेंशन, और ऑडियो-गाइडेड अवतार जनरेशन को एक ही मॉडल में एकीकृत करता है।

V3, 1 से 4 संदर्भ छवियाँ स्वीकार करता है और जनरेट किए गए वीडियो में सब्जेक्ट की पहचान बनाए रखता है। वीडियो-टू-वीडियो मोड सीमलेस सिंगल-शॉट कंटीन्यूएशन और सिनेमैटोग्राफिक ट्रांज़िशन के साथ मल्टी-शॉट स्विचिंग को संभव बनाता है।

Skywork ने 25 फरवरी, 2026 को SkyReels V4 की घोषणा की, यह एक ड्यूल-स्ट्रीम मॉडल है जो वीडियो और ऑडियो को साथ में 1080p/32fps तक जनरेट करता है और कंडीशनिंग इनपुट के तौर पर टेक्स्ट, इमेज, वीडियो क्लिप्स, मास्क, और ऑडियो स्वीकार करता है। हमारे जुलाई के लेख में एक सुधार: V4 अभी ओपन-सोर्स नहीं किया गया है। सितंबर 2026 तक SkyworkAI GitHub organization में V1 से V3 और Matrix-Game के रीपो मौजूद हैं, और V4 के वेट्स या पब्लिक API उपलब्ध नहीं हैं, इसलिए V3 ही Skywork की तरफ़ से रेफरेंस-टू-वीडियो की सबसे ऊपरी सीमा बना हुआ है।

उपलब्धता: पूरी तरह ओपन सोर्स। 1.3B से 14B पैरामीटर तक के मॉडल। 540p और 720p पर उपलब्ध। कोड और वेट्स GitHub और HuggingFace पर।

स्पेकमूल्य
अधिकतम अवधिअसीमित (ऑटोरिग्रेसिव)
रिज़ॉल्यूशन540p, 720p
पैरामीटर1.3B, 5B, 14B
संदर्भ छवियाँ1-4 इमेज (V3)
लाइसेंसओपन सोर्स
हार्डवेयरन्यूनतम RTX 4090, अनुशंसित 4-8x A100

स्तर 2: छोटी क्लिप्स के साथ मज़बूत रेफरेंस + एक्सटेंशन

ये मॉडल 8-60 सेकंड की क्लिप्स जनरेट करते हैं लेकिन मज़बूत संदर्भ छवि सपोर्ट और वीडियो एक्सटेंशन फ़ीचर देते हैं। लॉन्ग-फॉर्म कंटेंट के लिए, आप मॉडल के कंटीन्यूएशन या एक्सटेंशन एंडपॉइंट का इस्तेमाल करके क्लिप्स को आपस में जोड़ते हैं। कैरेक्टर संगति उन संदर्भ छवियों से आती है जो अलग-अलग जनरेशन में बनी रहती हैं।

आज ज़्यादातर क्रिएटर एक मिनट से लंबे कंटेंट के लिए यही व्यावहारिक वर्कफ़्लो इस्तेमाल करते हैं। प्रति-क्लिप क्वालिटी अक्सर नेटिव लॉन्ग-फॉर्म मॉडलों से ज़्यादा अच्छी होती है।

Kling 3.0 Omni (Kuaishou)

Kling 3.0 Omni, कैरेक्टर एलिमेंट्स, स्टाइल रेफरेंस, और मल्टी-शॉट स्टोरीबोर्डिंग को नेटिव 4K 60fps आउटपुट के साथ एक ही कॉल में मिलाता है।

Kling के पास किसी भी वीडियो मॉडल में सबसे संपूर्ण संदर्भ छवि सिस्टम है। यह संदर्भ इनपुट को तीन अलग-अलग श्रेणियों में बाँटता है, जिनमें से हर एक का अलग मक़सद है:

Reference Images (image_urls): स्टाइल और लुक की गाइडेंस के लिए 4 इमेज तक। आप इन्हें अपने प्रॉम्प्ट में @Image1, @Image2, आदि के रूप में टैग करते हैं। ये पहला फ्रेम बने बिना ओवरऑल लुक, सीन स्टाइल, और माहौल को प्रभावित करती हैं। एलिमेंट्स (elements): समर्पित कैरेक्टर/ऑब्जेक्ट इनपुट। हर एलिमेंट में एक frontal_image_url (साफ फ्रंट-फेसिंग फोटो) के साथ ऑप्शनल reference_image_urls (अतिरिक्त एंगल) होता है। आप इन्हें अपने प्रॉम्प्ट में @Element1, @Element2 के रूप में रेफर करते हैं। मॉडल कैरेक्टर की पहचान निकालकर उन्हें आपके बताए किसी भी सीन में रख देता है। एडवेंचर-मूवी-स्टाइल कंटेंट के लिए यह सबसे अहम फीचर है: एक कैरेक्टर फोटो अपलोड करें, फिर उन्हें जंगल में चलते हुए, ड्रैगन से लड़ते हुए, जो भी चाहें, वर्णित करें।

स्टार्ट/एंड फ्रेम्स (start_image_url, end_image_url): पहले या आखिरी फ्रेम के रूप में विशेष इमेज पिन करें। ये लिटरल फ्रेम हैं, स्टाइल गाइड नहीं।

तीनों कैटेगरी को मिलाकर कुल 7 रेफरेंस इनपुट तक की अनुमति है (जब रेफरेंस वीडियो भी इस्तेमाल हो रहा हो तो यह घटकर 4 रह जाता है)। "@Element1 and @Element2 are having dinner at this table on @Image1" जैसा एक ही प्रॉम्प्ट कैरेक्टर्स को सीन रेफरेंस के साथ जोड़ सकता है।

लॉन्ग-फॉर्म कंटेंट के लिए, Kling दो रास्ते देता है। मल्टी-शॉट मोड एक ही कॉल में 6 सीन तक जनरेट करता है, हर एक का अपना प्रॉम्प्ट और अवधि (हर एक 3-15 सेकंड) होती है। कैरेक्टर एलिमेंट्स सभी शॉट्स में अपने आप बने रहते हैं। एक्सटेंड API किसी पूरी हो चुकी वीडियो को जहाँ से वह रुकी थी वहीं से आगे बढ़ाता है, चेन्ड एक्सटेंशन के जरिए लगभग 3 मिनट तक पहुँचता है। V2V एडिटिंग मोड मौजूदा वीडियो (3-10 सेकंड) लेकर उसे एलिमेंट रेफरेंस और टेक्स्ट प्रॉम्प्ट का इस्तेमाल करके ट्रांसफॉर्म करता है, सोर्स से कैमरा मोशन और कैरेक्टर स्टेजिंग बरकरार रखते हुए आपके रेफरेंस के आधार पर कैरेक्टर्स और एनवायरनमेंट को नई स्टाइल देता है। इससे Kling पहले से मौजूद फुटेज को बेहतर बनाने के लिए खासतौर पर उपयोगी बन जाता है, जिसमें लो-फिडेलिटी 3D रेंडर भी शामिल हैं।

Kling 3.0 Omni टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, रेफरेंस-टू-वीडियो, और वीडियो एडिटिंग को नेटिव ऑडियो जनरेशन और लिप-सिंक के साथ एक ही मॉडल में एकीकृत करता है। जून 2026 में Kuaishou ने Kling 3.0 Turbo जोड़ा, जो एक तेज़ और सस्ता वेरिएंट है जिसमें 720p और 1080p पर ऑडियो शामिल है, और Omni की एडिटिंग पाइपलाइन को अपग्रेड करके 4K वीडियो स्वीकार करने और आउटपुट देने लायक बनाया गया। सितंबर 2026 तक कोई Kling 3.5 या 4.0 रिलीज़ नहीं हुआ है, इसलिए 3.0 Omni ही अभी का मौजूदा वीडियो मॉडल है।

उपलब्धता: Kuaishou, fal.ai, और Replicate के जरिए कमर्शियल API, जिसकी प्रति-सेकंड कीमत रेज़ोल्यूशन और वेरिएंट के अनुसार बदलती है। वेब इंटरफेस klingai.com पर उपलब्ध है।

स्पेकमान
नेटिव क्लिप लंबाई3-15 सेकंड
एक्सटेंडेड लंबाई~3 मिनट (चेन्ड एक्सटेंशन के जरिए)
रेज़ोल्यूशन720p, 1080p (Omni एडिटिंग में 4K)
रेफरेंस इमेज4 तक (@Image स्टाइल रेफ)
एलिमेंट्स4 तक (@Element कैरेक्टर रेफ, फ्रंटल + एंगल के साथ)
कुल रेफरेंसकुल मिलाकर 7 तक (वीडियो रेफ के साथ 4)
मल्टी-शॉटहाँ (स्टोरीबोर्ड में 6 शॉट तक)
ऑडियोनेटिव सिंक्रोनाइज्ड ऑडियो + लिप-सिंक
वीडियो एडिटिंगहाँ (मौजूदा वीडियो की टेक्स्ट-गाइडेड एडिटिंग)
APIKuaishou, fal.ai, Replicate

मल्टीपल रेफरेंस इमेज के साथ Kling इमेज टू वीडियो

Kling के बारे में यही सवाल सबसे ज्यादा पूछा जाता है, तो यहाँ मौजूदा मॉडल में मल्टी-इमेज रेफरेंस कैसे काम करता है इसका संक्षिप्त वर्णन दिया गया है, जो Kling के अपने VIDEO 3.0 Omni गाइड से लिया गया है। स्टैंडर्ड इमेज-टू-वीडियो एक तस्वीर लेकर उसे पहले फ्रेम के रूप में एनिमेट करता है। मल्टी-इमेज रेफरेंस एक अलग मोड है: आप कई इमेज अपलोड करते हैं, उन्हें प्रॉम्प्ट में टैग करते हैं, और मॉडल उनसे एक नया शॉट बनाता है। रिक्वेस्ट में रेफरेंस वीडियो न होने पर आप कुल मिलाकर 7 इमेज और एलिमेंट तक जोड़ सकते हैं, और रेफरेंस वीडियो होने पर यह घटकर 4 रह जाता है। एक कैरेक्टर एलिमेंट खुद अलग-अलग एंगल से ली गई 4 फोटो तक से, या 3 से 8 सेकंड की सिंगल-कैरेक्टर वीडियो क्लिप से बनाया जा सकता है, और आप उससे 5 से 30 सेकंड की वॉइस रिकॉर्डिंग जोड़ सकते हैं ताकि कैरेक्टर सभी शॉट्स में एक ही आवाज़ बनाए रखे। प्रॉम्प्ट में आप उन्हें स्टाइल या सीन रेफरेंस के लिए @Image1 और लॉक किए गए कैरेक्टर या ऑब्जेक्ट के लिए @Element1 (या आपने एलिमेंट को जो नाम दिया हो) के रूप में रेफर करते हैं, तो "@Grace walks through @Image1 at dusk" जैसा प्रॉम्प्ट आपके दिए सीन में एक कंसिस्टेंट कैरेक्टर डाल देता है। आउटपुट 720p या 1080p पर नेटिव ऑडियो के साथ 15 सेकंड तक चलता है, और वही एलिमेंट लाइब्रेरी Kling के मल्टी-शॉट स्टोरीबोर्ड में भी काम आती है, जो एक कैरेक्टर को छह-शॉट सीक्वेंस में बनाए रखने का तरीका है। अगर आपको वीडियो की बजाय सिर्फ कंसिस्टेंट स्टिल इमेज चाहिए, तो Kling IMAGE 3.0 अपने इमेज गाइड के अनुसार प्रति अनुरोध 10 रेफरेंस इमेज तक स्वीकार करता है, और एक आम वर्कफ़्लो यह है कि पहले कैरेक्टर को वहाँ लॉक कर लिया जाए, फिर उन स्टिल इमेज को एलिमेंट के रूप में फीड किया जाए।

Grok Imagine (xAI)

Grok Imagine रेफरेंस मोड को फर्स्ट-फ्रेम मोड से अलग रखता है, जिससे आप अपने प्रॉम्प्ट में 7 इमेज तक को कैरेक्टर या ऑब्जेक्ट रेफरेंस के रूप में टैग कर सकते हैं।

xAI ने 2026 की शुरुआत में Grok Imagine का Reference-to-Video मोड लॉन्च किया, जो 1-7 रेफरेंस इमेज को सपोर्ट करता है। डॉक्यूमेंटेशन में इसे इमेज-टू-वीडियो से स्पष्ट रूप से अलग बताया गया है: "इमेज-टू-वीडियो के विपरीत, जहाँ सोर्स इमेज स्टार्टिंग फ्रेम बन जाती है, रेफरेंस इमेज पहले फ्रेम को लॉक किए बिना वीडियो में जो दिखता है उसे प्रभावित करती हैं।"

आप अपने प्रॉम्प्ट में इमेज को <IMAGE_1>, <IMAGE_2>, आदि के रूप में टैग करते हैं। "the model from <IMAGE_1> walks onto the runway wearing the shirt from <IMAGE_2>" जैसा प्रॉम्प्ट एक व्यक्ति रेफरेंस को कपड़ों के रेफरेंस के साथ जोड़ता है। मॉडल वर्चुअल ट्राई-ऑन, प्रोडक्ट प्लेसमेंट, और सीन्स के बीच कैरेक्टर-कंसिस्टेंट स्टोरीटेलिंग को संभालता है।

एक सीमा: आप एक ही रिक्वेस्ट में रेफरेंस इमेज को इमेज-टू-वीडियो के साथ नहीं जोड़ सकते। यह या तो फर्स्ट-फ्रेम मोड है या रेफरेंस मोड, दोनों एक साथ नहीं।

Grok Imagine में एक वीडियो एक्सटेंशन एंडपॉइंट भी है जो मौजूदा वीडियो के अंत में नई फुटेज जोड़ता है। duration पैरामीटर सिर्फ नए हिस्से को नियंत्रित करता है। आप लंबी कंटेंट बनाने के लिए एक्सटेंशन को चेन कर सकते हैं।

xAI ने 3 जून 2026 को Grok Imagine 1.5 को API प्रीव्यू के रूप में रिलीज़ किया, फिर 16 जून को इसे grok-imagine-video-1.5 के रूप में जनरल अवेलेबिलिटी में लाया, साथ ही कंज़्यूमर ऐप्स के लिए एक Fast वेरिएंट भी रोलआउट किया गया। यह एक इमेज-टू-वीडियो मॉडल है जो एक ही स्टिल इमेज को सिनेमैटिक मोशन में एनिमेट करता है, जिसमें कैमरा मूव्स, वातावरण, फिजिक्स, और उसी इनफरेंस पास में नेटिव रूप से जनरेट किया गया सिंक्रोनाइज्ड ऑडियो शामिल है। यह कंसिस्टेंट सीन्स को चेन करने के लिए मल्टी-शॉट सीक्वेंसिंग को सपोर्ट करता है, लगभग 25 सेकंड में 6-सेकंड की 720p क्लिप जनरेट करता है, और लॉन्च के समय Artificial Analysis इमेज-टू-वीडियो एरिना में तीसरे स्थान पर रहा। सितंबर 2026 तक xAI का मॉडल पेज Grok Imagine Video 1.5 को $0.08 प्रति सेकंड और मूल Grok Imagine Video को $0.05 प्रति सेकंड पर सूचीबद्ध करता है। xAI का नया Grok Imagine Image 2.0 (इसके रिलीज़ नोट्स में सूचीबद्ध) एक स्टिल-इमेज मॉडल है, जो एनिमेट करने से पहले कैरेक्टर को लॉक करने के लिए उपयोगी है, लेकिन यह कोई नया वीडियो मॉडल नहीं है।

उपलब्धता: xAI API (जनवरी 2026 में लॉन्च), fal.ai, और Replicate। Python SDK, JavaScript/AI SDK, और REST API। ऑडियो के साथ 720p पर $0.05/सेकंड। X Premium सब्सक्राइबर्स के लिए भी उपलब्ध।

स्पेकमान
नेटिव क्लिप लंबाई1-15 सेकंड
एक्सटेंडेड लंबाईएक्सटेंशन API के जरिए चेन करने योग्य
रेज़ोल्यूशन480p, 720p
रेफरेंस इमेज1-7 (असली रेफरेंस, फर्स्ट-फ्रेम नहीं)
प्रॉम्प्ट टैग<IMAGE_1>, <IMAGE_2>, आदि
ऑडियोहाँ (720p)
वीडियो एडिटिंगहाँ (टेक्स्ट-गाइडेड)
APIxAI API, fal.ai, Replicate
API लागत$0.05/सेकंड (Video), $0.08/सेकंड (Video 1.5)

Seedance 2.0 (ByteDance)

Seedance 2.0 एक साथ 12 मल्टीमॉडल इनपुट तक स्वीकार करता है और नेटिव ऑडियो सिंक तथा 8+ भाषाओं में फोनीम-लेवल लिप-सिंक के साथ वीडियो जनरेट करता है।

ByteDance का Seedance 2.0 किसी भी मॉडल की तुलना में सबसे ज्यादा रेफरेंस इनपुट स्वीकार करता है: एक साथ 12 फाइल तक, जिनमें 9 इमेज, 3 वीडियो, और 3 ऑडियो फाइल तक शामिल हैं। मॉडल 8+ भाषाओं में फोनीम-लेवल लिप-सिंक के साथ नेटिव ऑडियो-वीडियो जनरेशन को सपोर्ट करता है।

हर इंडिविजुअल इमेज 30MB तक की हो सकती है। रेफरेंस वीडियो 2-15 सेकंड की होनी चाहिए। मॉडल इन रेफरेंस का उपयोग कैरेक्टर की बनावट, सीन स्टाइलिंग, और मोशन गाइडेंस के लिए करता है। अगली छलांग अब लॉन्च हो चुकी है। ByteDance ने 23 जून, 2026 को अपने Volcano Engine FORCE कॉन्फ्रेंस में Seedance 2.5 की घोषणा की और इसे 31 जुलाई, 2026 को रिलीज़ किया। Seed टीम की घोषणा के अनुसार, यह मल्टी-राउंड एक्सटेंशन के साथ 30 सेकंड तक का एक सिंगल नेटिव क्लिप जनरेट करता है, एक ही पास में 30 इमेज, 10 वीडियो क्लिप, और 10 ऑडियो क्लिप को रेफरेंस के रूप में स्वीकार करता है (50 फाइलें, जो पहले 12 थीं), और टाइमस्टैम्प-लेवल एडिटिंग जोड़ता है ताकि आप पूरे क्लिप को दोबारा जनरेट किए बिना उसके किसी एक पल को बदल सकें। यह सबसे पहले Jimeng और Doubao पर पहुंचा, फिर BytePlus ModelArk एंटरप्राइज़ API पर, और थर्ड-पार्टी प्लेटफॉर्म्स ने इसे तेज़ी से अपनाया: Runway के API में Runway चेंजलॉग के अनुसार 7 अगस्त, 2026 को Seedance 2.5 जोड़ा गया, जिसमें 4 से 30 सेकंड की अवधि और 30 तक रेफरेंस इमेज शामिल हैं। इस गाइड के नैरेटिव वर्कफ़्लो के लिए, 50 रेफरेंस के साथ एक 30-सेकंड की सिंगल टेक नीचे बताई गई क्लिप-स्टिचिंग की काफी ज़रूरत को खत्म कर देती है।

उपलब्धता: ByteDance ऑफिशियल API (Volcengine के ज़रिए, फरवरी 2026 में लॉन्च) और थर्ड-पार्टी API प्रोवाइडर। API के ज़रिए 480p-720p में आउटपुट, प्लेटफ़ॉर्म के ज़रिए 2K सिनेमा रिज़ॉल्यूशन तक।

स्पेकवैल्यू
नेटिव क्लिप लंबाई4-15 सेकंड
रिज़ॉल्यूशन2K तक (सिनेमा)
रेफरेंस इमेज9 इमेज + 3 वीडियो + 3 ऑडियो तक (कुल 12)
Seedance 2.5 क्लिप लंबाईनेटिव रूप से 30 सेकंड तक, एक्सटेंशन के साथ
Seedance 2.5 रेफरेंस30 इमेज + 10 वीडियो + 10 ऑडियो तक (कुल 50)
ऑडियोलिप-सिंक के साथ नेटिव (8+ भाषाएं)
APIByteDance/Volcengine, BytePlus ModelArk (2.5), Runway API (2.5), थर्ड-पार्टी प्रोवाइडर

Runway Gen-4.5

Runway Gen-4.5 ने 1,247 ELO के साथ Artificial Analysis Text-to-Video लीडरबोर्ड में टॉप पर लॉन्च किया, जो उस समय Veo 3 और Sora 2 Pro से आगे था। सितंबर 2026 तक एरिना में फेरबदल हो चुका था (Gemini Omni Flash और Alibaba का Wan 3.0 टॉप स्पॉट साझा करते हैं, जबकि Gen-4.5 टॉप टेन से बाहर है), लेकिन Gen-4.5 सिनेमैटिक क्वालिटी और कंट्रोलेबल एक्शन के लिए अभी भी एक मज़बूत मॉडल बना हुआ है, और Runway ने अभी तक Gen-5 लॉन्च नहीं किया है। यह मॉडल टेक्स्ट-टू-वीडियो के लिए 2-10 सेकंड के क्लिप जनरेट करता है और मल्टी-शॉट सीक्वेंसिंग के ज़रिए एक मिनट तक के कैरेक्टर-कंसिस्टेंट लॉन्ग-फॉर्म वीडियो को सपोर्ट करता है।

इमेज-टू-वीडियो को 2026 की शुरुआत में जोड़ा गया था और यह सभी आस्पेक्ट रेशियो के लिए रेफरेंस इमेज को सपोर्ट करता है। Runway के 2026 के बाकी कदम एक नए बेस मॉडल के बजाय एडिटिंग और राउटिंग से जुड़े थे: Aleph 2.0 (2 जून, 2026) एक मौजूदा 2 से 30 सेकंड के वीडियो को टेक्स्ट प्रॉम्प्ट और टाइमस्टैम्प पर पिन किए गए 5 तक कीफ्रेम इमेज से एडिट करता है, Gen-3 Alpha Turbo और मूल Gen-4 Aleph को 30 जुलाई, 2026 को API से रिटायर कर दिया गया, और अब API Gemini Omni Flash और Seedance 2.5 सहित थर्ड-पार्टी मॉडल भी सर्व करता है, यह सब Runway चेंजलॉग के अनुसार है। यह मॉडल डिफ्यूज़न आर्किटेक्चर के भीतर न्यूरल रेडियंस फील्ड्स और गॉसियन स्प्लैटिंग को इंटीग्रेट करता है, जिससे इसे केवल पिक्सेल-लेवल प्रेडिक्शन के बजाय 3D ज्यामितीय समझ मिलती है। इसका मतलब है बेहतर ऑब्जेक्ट परमानेंस और भौतिक रूप से प्रशंसनीय मोशन।

उपलब्धता: कमर्शियल API और वेब इंटरफ़ेस। Node और Python के लिए SDK। Replicate पर भी उपलब्ध।

स्पेकवैल्यू
नेटिव क्लिप लंबाई2-10 सेकंड
लॉन्ग-फॉर्म मोडलगभग 1 मिनट तक
रिज़ॉल्यूशन1080p तक
रेफरेंस इमेजप्रति जनरेशन 0-1
ऑडियोनेटिव ऑडियो जनरेशन
मल्टी-शॉटहां
APIहां (Runway, Replicate)

Google Veo 3.1

Google का Veo 3.1 नेटिव रूप से 4, 6, या 8 सेकंड के क्लिप जनरेट करता है। "Extend Video" फ़ीचर (फ़िलहाल प्रीव्यू में) क्लिप को जोड़कर लगभग 1-2.5 मिनट तक पहुंचाता है, हालांकि लंबे सीक्वेंस में कंसिस्टेंसी बिगड़ सकती है।

"Ingredients to Video" फ़ीचर इनपुट के रूप में 3 तक रेफरेंस इमेज स्वीकार करता है। आप एनिमेट करने के लिए कैरेक्टर, बैकग्राउंड, और मटेरियल टेक्सचर दे सकते हैं। जब आप रेफरेंस इमेज का इस्तेमाल करते हैं, तो मॉडल आपके विज़ुअल रेफरेंस के ज़्यादा करीब रहता है और कम रैंडम बदलाव करता है। एक सीमा: रेफरेंस इमेज मोड सिर्फ़ 8-सेकंड की अवधि के विकल्प के साथ ही काम करता है।

जनवरी 2026 तक, Veo 3.1 ने रेफरेंस-बेस्ड जनरेशन के लिए वर्टिकल वीडियो (9:16) और Vertex AI पर 4K अपस्केलिंग जोड़ दी। इसके बाद Google ने 31 मार्च, 2026 को Veo 3.1 Lite को अपने सबसे सस्ते वीडियो मॉडल के रूप में लॉन्च किया, 30 जून, 2026 को Veo 2.0 और 3.0 को रिटायर किया, और Gemini API चेंजलॉग के अनुसार सितंबर 2026 तक किसी Veo 4 की घोषणा नहीं की है। इसका नया वीडियो काम नीचे दिए गए Gemini Omni Flash में जा रहा है।

उपलब्धता: Google Vertex AI API, Gemini API, और Google Flow। Google Cloud अकाउंट ज़रूरी है।

स्पेकवैल्यू
नेटिव क्लिप लंबाई4, 6, या 8 सेकंड
एक्सटेंडेड लंबाईलगभग 1-2.5 मिनट
रिज़ॉल्यूशन4K तक (अपस्केलिंग के साथ)
रेफरेंस इमेज3 तक ("Ingredients to Video")
ऑडियोसिंक्रोनाइज़्ड डायलॉग और म्यूज़िक
APIVertex AI, Gemini API

Google Gemini Omni Flash

Google ने मई 2026 में I/O पर Gemini Omni फ़ैमिली की घोषणा की और अपने पहले मॉडल के रूप में Gemini Omni Flash लॉन्च किया। इसने जल्द ही Artificial Analysis एरिना में टॉप स्पॉट हासिल कर लिया, Veo 3.1 से भी आगे। इसका आइडिया है कन्वर्सेशनल वीडियो: आप टेक्स्ट, इमेज, या वीडियो से 10-सेकंड का क्लिप जनरेट करते हैं, फिर एक-दूसरे पर बनने वाले फ़ॉलो-अप इंस्ट्रक्शन के ज़रिए उसे एडिट करते हैं। लाइटिंग बदलें, आउटफिट बदलें, कैमरा एडजस्ट करें, यह सब शुरू से दोबारा जनरेट किए बिना।

रेफरेंस सपोर्ट के लिए, Omni Flash स्टाइल, मोशन, और इफ़ेक्ट रेफरेंस के तौर पर इमेज और छोटे वीडियो क्लिप स्वीकार करता है, और ऑडियो रेफरेंस की योजना है। कैरेक्टर कंसिस्टेंसी कन्वर्सेशनल एडिट के दौरान बनी रहती है, हालांकि Google के अपने डॉक्यूमेंटेशन में बताया गया है कि सीन बदलने और कैमरा पैन के दौरान यह डगमगा सकती है, इसलिए कैरेक्टर-हैवी आउटपुट को शिप करने से पहले उसकी समीक्षा करें।

उपलब्धता: API (gemini-omni-flash-preview) 30 जून, 2026 को Google AI Studio और Gemini API के ज़रिए पब्लिक प्रीव्यू में खुला, आउटपुट के प्रति सेकंड लगभग $0.10 पर, और gemini-omni-1.1-flash 27 अगस्त, 2026 को वीडियो एक्सटेंशन, इंटरपोलेशन, और रिज़ॉल्यूशन कंट्रोल के साथ जनरल एवेलेबिलिटी में पहुंचा, यह सब Gemini API चेंजलॉग के अनुसार है। हर क्लिप पर SynthID वॉटरमार्क होता है। कंज़्यूमर एक्सेस Gemini ऐप, Google Flow, और YouTube Shorts के ज़रिए चलता है, और Runway का API भी इसी की ओर रूट करता है।

स्पेकवैल्यू
नेटिव क्लिप लंबाई10 सेकंड (लंबी अवधि की योजना है)
रिज़ॉल्यूशन720p
रेफरेंस इनपुटइमेज + छोटे वीडियो क्लिप (ऑडियो की योजना है)
एडिटिंगकन्वर्सेशनल, इटरेटिव
ऑडियोनेटिव
APIGemini API (gemini-omni-1.1-flash के रूप में GA), ~$0.10/सेकंड

OpenAI Sora 2 / Sora 2 Pro

बंद किया जा रहा है (2026): OpenAI, Sora को बंद कर रहा है। कंज़्यूमर Sora ऐप 26 अप्रैल, 2026 को बंद हो गया, और Sora 2 API 24 सितंबर, 2026 को सनसेट हो रहा है, बिना किसी घोषित उत्तराधिकारी के, यह OpenAI के डिप्रिकेशन पेज के अनुसार है। नीचे दी गई क्षमताएं अभी भी उल्लेखनीय हैं, लेकिन Sora पर नई पाइपलाइन न बनाएं। इसके बजाय Kling, Grok Imagine, या किसी ओपन मॉडल का इस्तेमाल करें।

Sora 2 Pro 20 सेकंड तक के क्लिप जनरेट करता है। Characters API, Kling या Grok से एक अलग तरीका अपनाता है: स्टैटिक इमेज अपलोड करने के बजाय, आप API को एक वीडियो क्लिप (1-3 सेकंड की टाइमस्टैम्प रेंज के साथ) पर पॉइंट करके एक character_id बनाते हैं। Sora, चेहरे की संरचना, शरीर के अनुपात, कपड़ों की स्टाइल, और अन्य पहचान करने वाली विशेषताओं को निकालने के लिए वीडियो फ़्रेम का विश्लेषण करता है। वह character_id अनिश्चित काल तक बना रहता है और भविष्य में असीमित जनरेशन में दोबारा इस्तेमाल किया जा सकता है।

आप प्रति जनरेशन 2 तक अपलोड किए गए कैरेक्टर को रेफरेंस कर सकते हैं। मार्च 2026 तक, कैरेक्टर रेफरेंस सिर्फ़ लोगों के लिए ही नहीं, बल्कि ऑब्जेक्ट और जानवरों के लिए भी काम करते हैं। वीडियो एक्सटेंशन, कंटीन्यूएशन के लिए कॉन्टेक्स्ट के तौर पर पूरे शुरुआती क्लिप का इस्तेमाल करता है।

कैरेक्टर सिस्टम को कैरेक्टर बनाने के लिए वीडियो इनपुट (स्टैटिक इमेज नहीं) की ज़रूरत होती है। अगर आपके पास सिर्फ़ फ़ोटो हैं, तो आपको पहले एक छोटा वीडियो जनरेट करना होगा, फिर उससे कैरेक्टर निकालना होगा।

उपलब्धता: प्रोडक्शन वर्कफ़्लो के लिए Batch API सपोर्ट के साथ OpenAI API।

स्पेकवैल्यू
नेटिव क्लिप लंबाई20 सेकंड तक
रिज़ॉल्यूशन1920x1080 तक
कैरेक्टर रेफरेंसप्रति जनरेशन 2 तक (परसिस्टेंट character_id)
कैरेक्टर इनपुटवीडियो क्लिप (1-3s टाइमस्टैम्प रेंज), स्टैटिक इमेज नहीं
ऑडियोसिंक्रोनाइज़्ड
एक्सटेंशनहां (पूरा क्लिप कॉन्टेक्स्ट के तौर पर)
APIOpenAI API + Batch API

MiniMax Hailuo 02

Hailuo 02 ने लॉन्च के समय Artificial Analysis बेंचमार्क में ग्लोबल स्तर पर #2 रैंक हासिल की, जो Veo 3 को पीछे छोड़ते हुए थी। यह नेटिव 1080p पर 10-सेकंड के क्लिप जनरेट करता है, जिसमें फ़ील्ड की कुछ बेहतरीन फिज़िक्स सिमुलेशन शामिल है। यह मॉडल जिम्नास्टिक और एक्रोबेटिक्स जैसे एक्सट्रीम मोशन को बिना बिखरे संभाल लेता है।

यह फेशियल रिकग्निशन और बॉडी ट्रैकिंग के ज़रिए मज़बूत कैरेक्टर कंसिस्टेंसी के साथ इमेज-टू-वीडियो जनरेशन को सपोर्ट करता है। Noise-aware Compute Redistribution आर्किटेक्चर सीन की जटिलता के आधार पर डायनामिक रूप से कंप्यूट आवंटित करता है। MiniMax अब Hailuo 02 से आगे बढ़कर Hailuo 2.3 परिवार (Standard, Pro, Fast, Fast Pro) पर आ चुका है, जो फिजिकल एक्शन, स्टाइलाइज़ेशन और कैरेक्टर माइक्रो-एक्सप्रेशन को बेहतर बनाता है। यह 1080p पर 6 सेकंड या 768p पर 10 सेकंड का आउटपुट देता है और MiniMax प्लेटफ़ॉर्म तथा fal.ai के ज़रिए उपलब्ध है।

उपलब्धता: कमर्शियल API. MiniMax प्लेटफ़ॉर्म, fal.ai, और Replicate के ज़रिए उपलब्ध। $0.28 प्रति वीडियो।

स्पेकवैल्यू
नेटिव क्लिप लंबाई10 सेकंड तक
रिज़ॉल्यूशन1080p नेटिव
संदर्भ छवियाँहाँ (I2V मोड)
ऑडियोनेटिव नहीं
फिज़िक्सबेस्ट-इन-क्लास सिमुलेशन
APIMiniMax, fal.ai, Replicate

MiniMax H3 (Hailuo 3.0)

MiniMax ने 31 जुलाई, 2026 को Hailuo 2.x लाइन की जगह MiniMax H3 लॉन्च किया, और इससे इस गाइड में Hailuo का स्थान बदल जाता है। जहाँ Hailuo 02 एक फर्स्ट-फ्रेम मॉडल था, वहीं H3 एक ऑम्नी-मॉडल मॉडल है: एक ही ट्रांसफॉर्मर टेक्स्ट, इमेज, वीडियो और ऑडियो को एक साथ पढ़ता है और MiniMax की घोषणा के अनुसार नेटिव स्टीरियो ऑडियो के साथ 2K तक 4 से 15 सेकंड की क्लिप देता है। इसका रेफरेंस मोड (Ref2VA) 9 संदर्भ छवियों, 3 संदर्भ वीडियो क्लिप, और 3 ऑडियो क्लिप तक स्वीकार करता है, जो कुल 12 फ़ाइलों तक सीमित है, जो इसे Kling और Seedance 2.0 जैसे ट्रू-रेफरेंस क्लास में रखता है, और एक फर्स्ट-एंड-लास्ट-फ्रेम मोड (FL2VA) क्लासिक कीफ्रेम वर्कफ़्लो को कवर करता है। Artificial Analysis टेक्स्ट-टू-वीडियो एरीना पर H3 और H3 Max एंट्रीज़ सितंबर 2026 तक Omni Flash और Wan 3.0 से बस थोड़ा पीछे बैठती हैं।

सेल्फ-होस्टर्स के लिए बड़ी खबर यह है कि MiniMax ने अगस्त 2026 में 33B बेस वेट्स Hugging Face पर रिलीज़ किए, जिसमें FL2VA और Ref2VA दोनों चेकपॉइंट शामिल हैं। लाइसेंस MiniMax H3 Community License है, और मॉडल कार्ड USA, EU, UK, और साउथ कोरिया के यूज़र्स को उपयोग से पहले एक आवेदन फ़ॉर्म जमा करने को कहता है, इसलिए यह Apache-स्टाइल ओपन के बजाय एक रीजनल तारे (asterisk) के साथ ओपन है।

उपलब्धता: MiniMax API और प्लेटफ़ॉर्म, fal.ai और अन्य होस्ट, साथ ही डाउनलोड करने योग्य वेट्स।

स्पेकवैल्यू
नेटिव क्लिप लंबाई4-15 सेकंड
रिज़ॉल्यूशन2K तक (768p डिफ़ॉल्ट शॉर्ट साइड)
संदर्भ छवियाँ9 इमेज + 3 वीडियो + 3 ऑडियो तक (कुल 12, Ref2VA)
कीफ्रेमफर्स्ट और/या लास्ट फ्रेम (FL2VA)
ऑडियोनेटिव स्टीरियो, 32 kHz
ओपन वेट्सहाँ, 33B, MiniMax H3 Community License (USA/EU/UK/KR के लिए आवेदन ज़रूरी)
APIMiniMax, fal.ai

Luma Ray3.2

Luma के Ray2 की जगह अब Ray3 परिवार आ चुका है। Ray3 (सितंबर 2025) ने आइडेंटिटी लॉक के लिए Character Reference और एक Modify वीडियो-टू-वीडियो मोड जोड़ा, और Ray3.2 (9 जून, 2026) ने प्रति क्लिप 16 कीफ्रेम तक फ्रेम-लेवल कंट्रोल, एक Reframe फ़ीचर, और 20 सेकंड तक की क्लिप जोड़ीं, साथ ही Ray3 लाइन का पहला पब्लिक API भी दिया। आउटपुट नेटिव 1080p है, जिसमें Hi-Fi अपस्केल के ज़रिए 4K उपलब्ध है। इमेज-टू-वीडियो संदर्भ छवियों को स्टार्ट या एंड कीफ्रेम के रूप में स्वीकार करता है।

उपलब्धता: Luma API और वेब इंटरफेस।

स्पेकवैल्यू
नेटिव क्लिप लंबाई20 सेकंड तक (Ray3.2)
संदर्भ प्रकारस्टार्ट/एंड कीफ्रेम + Character Reference (आइडेंटिटी)
रिज़ॉल्यूशन1080p नेटिव, अपस्केल के ज़रिए 4K
संदर्भ छवियाँहाँ (कीफ्रेम + कैरेक्टर रेफ)
APILuma API

Pika 2.5

Pika Pikaframes के साथ एक कीफ्रेम-आधारित तरीका अपनाता है। 2-5 कीफ्रेम (मुख्य क्षणों पर संदर्भ छवियाँ) अपलोड करें और मॉडल उनके बीच स्मूथ ट्रांज़िशन जनरेट करता है। कुल अवधि 20-25 सेकंड तक पहुँचती है।

Pikascenes 10 संदर्भ छवियों तक स्वीकार करता है और उन्हें एक ही वीडियो में मिला देता है। मॉडल इमेज रिकग्निशन का उपयोग करके स्वचालित रूप से हर रेफरेंस की भूमिका (कैरेक्टर, बैकग्राउंड, प्रॉप) पता लगाता है।

उपलब्धता: Pika वेब प्लेटफ़ॉर्म और API. फ्री से लेकर Pro तक के सब्सक्रिप्शन प्लान।

स्पेकवैल्यू
नेटिव क्लिप लंबाई5-10 सेकंड
Pikaframes लंबाई20-25 सेकंड
रिज़ॉल्यूशन1080p तक
संदर्भ छवियाँ10 तक (Pikascenes), 2-5 कीफ्रेम (Pikaframes)
APIहाँ

Vidu Q3 (ShengShu)

Vidu एक ऐसा सेक्शन डिज़र्व करता है जो इस गाइड के पुराने वर्ज़न में नहीं था, क्योंकि इसकी Q3 लाइन उपलब्ध सबसे मज़बूत सब्जेक्ट-रेफरेंस सिस्टम्स में से एक बन चुकी है। ShengShu ने 2026 की शुरुआत में नेटिव ऑडियो और 16 सेकंड तक की क्लिप के साथ Vidu Q3 रिलीज़ किया, और 13 अप्रैल, 2026 को इसके लॉन्च अनाउंसमेंट के अनुसार Q3 Reference-to-Video जोड़ा। यह रेफरेंस मोड एक ही रिक्वेस्ट में सब्जेक्ट्स, वातावरण, कॉस्ट्यूम, प्रॉप्स, और विज़ुअल स्टाइल को जोड़ता है। Vidu API डॉक्स के अनुसार, reference2video एंडपॉइंट 7 संदर्भ छवियों तक लेता है, जिन्हें आप प्रॉम्प्ट में @1, @2, और इसी तरह टैग करते हैं ("@1 and @2 are cooking together"), अवधि viduq3 पर 3 से 16 सेकंड तक चलती है, रिज़ॉल्यूशन 1080p तक जाता है, और ऑडियो जनरेशन एक फ्लैग है। यह एक ही क्लिप के भीतर इंटेलिजेंट कैमरा स्विचिंग भी करता है, जो असामान्य और डायलॉग सीन्स के लिए उपयोगी है। ShengShu का कहना है कि Q3 ने SuperCLUE के पहले Reference-to-Video लीडरबोर्ड में टॉप किया, और जब हमने पहली बार यह गाइड लिखी थी, तब Vidu पहले से ही वह मॉडल था जिसने VBench 2.0 पर Veo को आगे धकेला था।

उपलब्धता: Vidu वेब ऐप और API (viduq3, viduq3-turbo), साथ ही Alibaba Cloud Model Studio और थर्ड-पार्टी होस्ट।

स्पेकवैल्यू
नेटिव क्लिप लंबाई3-16 सेकंड
रिज़ॉल्यूशन1080p तक
संदर्भ छवियाँ7 तक (@1, @2 टैग)
संदर्भ प्रकारसब्जेक्ट्स, वातावरण, प्रॉप्स, कॉस्ट्यूम, स्टाइल
ऑडियोनेटिव (साउंड इफेक्ट्स, डायलॉग, म्यूज़िक)
APIVidu API, Alibaba Cloud Model Studio

टियर 3: सेल्फ-होस्टेड वर्कफ़्लो के लिए ओपन-सोर्स मॉडल

ये मॉडल छोटी क्लिप जनरेट करते हैं लेकिन ये पूरी तरह ओपन हैं। आप इन्हें अपने खुद के हार्डवेयर पर चला सकते हैं, फाइन-ट्यून कर सकते हैं, और API डिपेंडेंसी के बिना कस्टम एक्सटेंशन पाइपलाइन बना सकते हैं।

Wan 2.1 (Alibaba)

Wan 2.1 वह फाउंडेशन है जिस पर कई अन्य मॉडल (Helios समेत) बने हैं। Wan-VAE आर्किटेक्चर टेम्पोरल जानकारी को बनाए रखते हुए किसी भी लंबाई के 1080p वीडियो को एनकोड और डीकोड करता है। मॉडल 480p और 720p पर I2V वैरिएंट्स में आता है, साथ ही एक First-Last-Frame-to-Video मॉडल भी है जो दो संदर्भ छवियों के बीच वीडियो जनरेट करता है।

Wan-Edit विशिष्ट संरचनाओं या कैरेक्टर पोज़ को बनाए रखते हुए संदर्भ छवियों का उपयोग करके स्टाइल और कंटेंट ट्रांसफर की अनुमति देता है। Wan 2.2 (जुलाई 2025) नया ओपन रिलीज़ है, एक Mixture-of-Experts मॉडल जिसका 5B वैरिएंट एक ही RTX 4090 पर चलता है, और अभी भी Apache 2.0 के तहत है। सेल्फ-होस्टर्स के लिए एक ज़रूरी चेतावनी: Wan 2.5 पर आकर क्लोज़्ड हो गया। नए Wan 2.5, 2.6, 2.7, और अब Wan 3.0 ने सिंक ऑडियो और उच्च रिज़ॉल्यूशन जोड़ा लेकिन ये API-ओनली हैं, इनके पब्लिक वेट्स नहीं हैं, इसलिए 2.2 अभी भी ओपन सीलिंग है। Wan 3.0 अगस्त 2026 में Alibaba Cloud Model Studio पर आया और इसके मॉडल पेज के अनुसार, यह टेक्स्ट, इमेज, वीडियो, और ऑडियो रेफरेंस से 480p, 720p, या 1080p पर एक ही टेक में 30 सेकंड तक जनरेट करता है, और यह सितंबर 2026 तक Artificial Analysis टेक्स्ट-टू-वीडियो एरीना में Gemini Omni Flash के साथ टॉप शेयर करता है। यह एक होस्टेड प्रोडक्ट है, डाउनलोड नहीं। उन SEO पेजों को नज़रअंदाज़ करें जो दावा करते हैं कि Wan 2.7 या 3.0 वेट्स डाउनलोड करने योग्य हैं। ऑफिशियल GitHub org और Hugging Face अकाउंट 2.2 तक ही सीमित हैं (नवीनतम अपलोड Wan2.2-Animate रीफ्रेश हैं)।

स्पेकवैल्यू
पैरामीटर1.3B, 5B, 14B (2.1); 5B + 14B MoE (2.2)
I2V मोडI2V-480P, I2V-720P, FLF2V-720P
ओपन सीलिंगWan 2.2 (2.5 से 3.0 तक API-ओनली हैं)
लाइसेंसApache 2.0
हार्डवेयर8GB+ VRAM (छोटे वैरिएंट)
प्लेटफ़ॉर्मDiffusers, ComfyUI

HunyuanVideo (Tencent)

Tencent का 13B पैरामीटर मॉडल 2025 के अधिकांश समय ओपन-सोर्स वीडियो जनरेशन का लीडर रहा। HunyuanVideo-I2V एक प्री-ट्रेंड MLLM के साथ टोकन रिप्लेस तकनीक का उपयोग करके संदर्भ छवि की जानकारी को शामिल करता है। HunyuanVideo-1.5, नवंबर 2025 में रिलीज़ हुआ, दक्षता में सुधार करता है। HunyuanCustom मल्टीमॉडल-संचालित कस्टमाइज़्ड वीडियो जनरेशन को सक्षम बनाता है।

स्पेकवैल्यू
पैरामीटर13B
I2Vहाँ (टोकन रिप्लेस तकनीक)
लाइसेंसओपन सोर्स
हार्डवेयर60GB+ VRAM (720p)
वैरिएंटBase, I2V, 1.5, Avatar, Custom

LTX-2 (Lightricks)

Lightricks ने जनवरी 2026 में LTX-2 को पूरे वेट्स, इंफरेंस कोड, और ट्रेनिंग कोड के साथ ओपन-सोर्स किया। यह एक DiT-आधारित मॉडल है जो एक ही पास में वीडियो और सिंक्रोनाइज़्ड ऑडियो जनरेट करता है, नेटिव 4K पर और 50fps तक, 20 सेकंड तक की क्लिप के साथ। इमेज-टू-वीडियो और मल्टी-कीफ्रेम कंडीशनिंग बिल्ट-इन है, इसलिए आप क्लिप के साथ-साथ बिंदुओं पर संदर्भ स्टिल को उसी तरह पिन कर सकते हैं जैसे आप Pikaframes के साथ करते। लाइसेंस ही असली मुद्दा है, या नहीं है, यह आपके आकार पर निर्भर करता है। LTX-2 रिसर्च के लिए और $10M से कम वार्षिक राजस्व वाले कमर्शियल उपयोग के लिए मुफ़्त है। उससे ऊपर आपको कमर्शियल लाइसेंस चाहिए, इसलिए यह सख़्त अर्थ में ओपन सोर्स नहीं बल्कि ओपन वेट्स है। LTX-2.3 बेहतर ऑडियो और प्रॉम्प्ट पालन के साथ एक 22B पैरामीटर अपडेट था, और LTX-2.5, सितंबर 2026 तक का मौजूदा चेकपॉइंट, 22B साइज़ बरकरार रखता है और नेटिव मल्टीशॉट जनरेशन जोड़ता है जो कई जुड़े हुए शॉट्स में एक किरदार और लुक बनाए रखता है, प्लेन VAE रीकंस्ट्रक्शन की जगह एक डिफ्यूज़न वीडियो डिकोडर, और लंबे प्रॉम्प्ट के लिए Gemma 4 12B टेक्स्ट एनकोडर, फिर भी वही $10M राजस्व सीमा वाले LTX-2.x कम्युनिटी लाइसेंस के तहत। वेट्स Hugging Face पर डिस्टिल्ड वेरिएंट्स, LoRA एडैप्टर्स, और ComfyUI तथा Diffusers इंटीग्रेशन के साथ मौजूद हैं, और होस्टेड API LTX प्लेटफ़ॉर्म, fal.ai, और Replicate पर चलते हैं।

स्पेकवैल्यू
पैरामीटर्स22B (LTX-2.3 और LTX-2.5)
मैक्स क्लिप~20 सेकंड
रिज़ॉल्यूशननेटिव 4K, 50fps तक
ऑडियोनेटिव सिंक्रोनाइज़्ड
I2Vहां (इमेज + मल्टी-कीफ़्रेम कंडीशनिंग)
लाइसेंसLTX-2 कम्युनिटी लाइसेंस ($10M ARR से कम में मुफ़्त)
हार्डवेयरकंज़्यूमर GPU के लिए डिस्टिल्ड और FP8 वेरिएंट्स

CogVideoX (Tsinghua/Zhipu AI)

CogVideoX एक 3D कॉज़ल VAE इस्तेमाल करता है जो सीक्वेंस लेंथ घटाता है और फ़्लिकरिंग रोकता है। एडैप्टिव LayerNorm ट्रांसफ़ॉर्मर टेक्स्ट-वीडियो अलाइनमेंट को बेहतर बनाता है। यह 2B (Apache 2.0) और 5B (रिसर्च लाइसेंस) वेरिएंट में नेटिव Diffusers इंटीग्रेशन के साथ उपलब्ध है।

क्लिप्स 720x480 पर 6-10 सेकंड के होते हैं। छोटे हैं, लेकिन क्वालिटी-टू-कंप्यूट रेशियो अच्छा है और यह 12GB GPU पर चलता है।

स्पेकवैल्यू
पैरामीटर्स2B, 5B
I2Vहां (CogVideoXImageToVideoPipeline)
रिज़ॉल्यूशन720x480, 8fps पर
लाइसेंसApache 2.0 (2B), रिसर्च (5B)
हार्डवेयर12GB VRAM

फ़र्स्ट-फ़्रेम बनाम ट्रू रेफ़रेंस: महत्वपूर्ण अंतर

हर "रेफ़रेंस इमेज" सपोर्ट एक जैसा नहीं होता। सही मॉडल चुनने के लिए यह अंतर समझना ज़रूरी है।

फ़र्स्ट-फ़्रेम मॉडल (LongCat, Helios, Hailuo, Luma Ray2, HunyuanVideo) आपकी इमेज को शाब्दिक ओपनिंग फ़्रेम के रूप में लेते हैं। मॉडल उसी सटीक विज़ुअल से आगे एनिमेट करता है। आप किसी किरदार की हेडशॉट अपलोड करके उसे किसी अलग सीन में वर्णित नहीं कर सकते। इमेज ही सीन है।

ट्रू रेफ़रेंस मॉडल (Kling, Grok Imagine, Seedance, Vidu Q3, MiniMax H3, SkyReels V3) आपकी इमेज से पहचान निकालते हैं और उस किरदार/ऑब्जेक्ट को आपके द्वारा बताए गए किसी भी सीन में रखते हैं। किसी व्यक्ति की फ़ोटो अपलोड करें, फिर प्रॉम्प्ट करें "वह व्यक्ति सूर्यास्त के समय एक जंगल से गुज़रता है।" किरदार अपनी पहचान बनाए रखते हुए बिल्कुल नए माहौल में दिखता है। एडवेंचर मूवी जैसी मल्टी-सीन नैरेटिव सामग्री के लिए यही चाहिए।

कैरेक्टर ID मॉडल (Sora 2 Pro) स्थिर इमेज के बजाय वीडियो क्लिप से पहचान निकालते हैं। आप एक बार परसिस्टेंट कैरेक्टर ID बनाते हैं और उसे भविष्य की असीमित जनरेशन में दोबारा इस्तेमाल करते हैं।

स्टाइल/इनग्रीडिएंट मॉडल (Veo 3.1) रेफ़रेंस इमेज का इस्तेमाल विशिष्ट किरदार पहचान निकालने के बजाय विज़ुअल स्टाइल, टेक्सचर, और समग्र लुक को प्रभावित करने के लिए करते हैं। किसी प्रोजेक्ट में विज़ुअल कंसिस्टेंसी बनाए रखने के लिए अच्छा, अलग-अलग किरदार नियंत्रण के लिए कम सटीक।

10-मिनट के वीडियो के लिए असली वर्कफ़्लो

2026 के मध्य में स्थिति के बारे में यह ईमानदार राय है। कोई भी एकल मॉडल एक ही शॉट में 10 मिनट का कंसिस्टेंट, हाई-क्वालिटी वीडियो भरोसे से जनरेट नहीं करता। LongCat Video 15 मिनट के दावों के साथ सबसे करीब पहुंचता है, लेकिन उन लंबाइयों पर क्वालिटी और कोहेरेंस काफ़ी अलग-अलग होते हैं। Helios और SkyReels V2 क्रमशः "मिनट-स्केल" और "इनफ़िनिट-लेंथ" वीडियो जनरेट करते हैं, लेकिन आउटपुट को सावधानीपूर्वक प्रॉम्प्टिंग और अक्सर कई प्रयासों की ज़रूरत होती है।

जो वर्कफ़्लो अधिकतर क्रिएटर्स के लिए 5-15 मिनट के वीडियो बनाने में वाकई काम करता है, वह कई तरीकों को मिलाता है:

टॉकिंग हेड / अवतार सामग्री के लिए: LongCat Video का 2026 ऑडियो-ड्रिवन मोड या SkyReels V3 का अवतार जनरेशन एक कंसिस्टेंट टॉकिंग किरदार के 5+ मिनट बना सकता है। यह "बटन दबाओ, लंबा वीडियो पाओ" के सबसे करीब है।

कई सीन वाली नैरेटिव सामग्री के लिए (एडवेंचर मूवी स्टाइल): ट्रू कैरेक्टर रेफ़रेंस इमेज के साथ Kling 3.0, Grok Imagine, या Seedance 2.0 का इस्तेमाल करें। हर 10-15 सेकंड के अलग-अलग शॉट जनरेट करें। किरदार की पहचान बनाए रखने के लिए हर जनरेशन में वही @Element या <IMAGE> रेफ़रेंस इस्तेमाल करें। मल्टी-शॉट मोड (Kling प्रति कॉल 6 शॉट सपोर्ट करता है) या एक्सटेंड API से शॉट्स को जोड़ें। Kling इस वर्कफ़्लो के लिए सबसे ज़्यादा आज़माया गया है। Grok Imagine का "रेफ़रेंस मोड" और "फ़र्स्ट-फ़्रेम मोड" के बीच स्पष्ट अलगाव इसे एक मज़बूत विकल्प बनाता है। Seedance 2.5 अब सबसे ज़्यादा रेफ़रेंस इनपुट स्वीकार करता है (50 फ़ाइलें) और 30-सेकंड के टेक जनरेट करता है, जो स्टिच की संख्या को लगभग आधा कर देता है, और Vidu Q3 (@ टैग के साथ 7 रेफ़रेंस) और MiniMax H3 (12 फ़ाइलें) विश्वसनीय नए विकल्प हैं।

कई क्लिप में किरदार की कंसिस्टेंसी के लिए: Sora 2 Pro का परसिस्टेंट character_id सिस्टम बहुत लंबे प्रोजेक्ट्स के लिए सबसे साफ़-सुथरा तरीका है। एक छोटी वीडियो से एक बार किरदार निकालें, फिर उस ID को रेफ़र करते हुए दर्जनों क्लिप जनरेट करें। किरदार की पहचान समय के साथ नहीं बिगड़ती क्योंकि यह हर बार इमेज से फिर से इंटरप्रेट किए जाने की बजाय परसिस्टेंट एम्बेडिंग के रूप में स्टोर होती है।

स्टाइल-ट्रांसफ़र की गई सामग्री के लिए: fal.ai पर Lucy Restyle मौजूदा वीडियो को 30 मिनट तक प्रोसेस करता है, मोशन बनाए रखते हुए AI स्टाइल ट्रांसफ़ॉर्मेशन लागू करता है। अगर आपके पास सोर्स फ़ुटेज है, तो यह जनरेशन लेंथ की समस्या को पूरी तरह टाल देता है। सोर्स वीडियो के प्रति सेकंड $0.01।

ओपन-सोर्स पाइपलाइन के लिए: Wan 2.2 या Helios पर वीडियो कंटिन्यूएशन लूप के साथ बनाएं, या MiniMax H3 के Ref2VA चेकपॉइंट पर अगर उसका कम्युनिटी लाइसेंस आपके क्षेत्र के लिए काम करता है, क्योंकि यह 9-इमेज रेफ़रेंस मोड वाला पहला ओपन मॉडल है। एक क्लिप जनरेट करें, अगली क्लिप के लिए आख़िरी फ़्रेम को स्टार्ट फ़्रेम की तरह इस्तेमाल करें, दोहराएं। ComfyUI वर्कफ़्लो इसे ऑटोमेट कर देते हैं। कई बार दोहराने पर कंसिस्टेंसी घटती है लेकिन यह मुफ़्त और नियंत्रणीय है।

मूल चुनौती वही बनी हुई है: ट्रू रेफ़रेंस इमेज सपोर्ट के बावजूद, दर्जनों क्लिप में किरदार का बहाव (ड्रिफ्ट) बढ़ता जाता है। चेहरे की विशेषताएं, बाल, कपड़े, और त्वचा का रंग धीरे-धीरे बदलते हैं। वर्कअराउंड (हाई-क्वालिटी रेफ़रेंस फ़ोटो, कंसिस्टेंट प्रॉम्प्टिंग, शॉट बैचिंग) ज़रूरी हैं। लेकिन Kling और Grok Imagine जैसे मॉडल जो किरदार की पहचान को सीन कंपोज़िशन से अलग करते हैं, इसे फ़र्स्ट-फ़्रेम-ओनली मॉडल की तुलना में काफ़ी आसान बनाते हैं।

3D स्कैफ़ोल्ड अप्रोच: रेंडर लो, ट्रांसफ़ॉर्म हाई

एक वर्कफ़्लो लोकप्रिय हो रहा है जो अधिकतर लॉन्ग-फ़ॉर्म जनरेशन समस्याओं को पूरी तरह टाल देता है। AI मॉडल से शुरू से 10 मिनट का वीडियो जनरेट करने के लिए कहने के बजाय, आप सही कैमरा वर्क, किरदार ब्लॉकिंग, और टाइमिंग के साथ एक लो-फ़िडेलिटी 3D कटसीन रेंडर करते हैं, फिर उसे रेफ़रेंस इमेज और एनहांसमेंट प्रॉम्प्ट के साथ वीडियो-टू-वीडियो मॉडल से गुज़ारते हैं। 3D इंजन स्ट्रक्चर संभालता है। AI सौंदर्यशास्त्र (एस्थेटिक्स) संभालता है।

यह इसलिए काम करता है क्योंकि V2V ट्रांसफ़ॉर्मेशन पूरी जनरेशन से ज़्यादा संकुचित समस्या है। मॉडल को कैमरा मोशन, किरदार प्लेसमेंट, या सीन कंपोज़िशन का आविष्कार नहीं करना पड़ता। उसे बस मौजूदा फ़ुटेज को आपके विज़ुअल रेफ़रेंस के अनुसार फ़ोटोरियलिस्टिक दिखाना है। यह कहीं ज़्यादा हल करने योग्य है, और यह उतनी भी लंबाई तक स्केल करता है जितनी आपका 3D इंजन रेंडर कर सकता है।

यह क्यों काम करता है

आपका 3D इंजन आपको वह सब कुछ देता है जिससे AI वीडियो मॉडल अभी भी जूझते हैं: सटीक कैमरा नियंत्रण, फ़्रेम भर सटीक किरदार प्लेसमेंट, सही फ़िज़िक्स इंटरैक्शन, और मिनटों के फ़ुटेज में कंसिस्टेंट टाइमिंग। डॉली ज़ूम, ट्रैकिंग शॉट, संकेत पर फ़्रेम में आते-जाते किरदार, यह सब 3D इंजन में तुच्छ है, टेक्स्ट-प्रॉम्प्टेड जनरेशन में अविश्वसनीय है। V2V मॉडल का एकमात्र काम मैटेरियल, लाइटिंग, और टेक्सचर को फ़ोटोरियलिस्टिक आउटपुट में बदलना है, जबकि आपके द्वारा पहले से तय की गई ज्यामिति और मोशन को बनाए रखना है।

किरदार की कंसिस्टेंसी भी आसान हो जाती है। 50 अलग-अलग AI जनरेशन में पहचान के बहाव से जूझने के बजाय, आप हर फ़्रेम में मॉडल को वही 3D किरदार दिखा रहे हैं। रेफ़रेंस इमेज मॉडल को बताती हैं कि अंतिम आउटपुट में वह किरदार कैसा दिखना चाहिए। यह हर बार शुरू से एक कंसिस्टेंट किरदार जनरेट करने से आसान समस्या है।

और लंबाई अब कोई सीमा नहीं रह जाती। Lucy Restyle एक ही कॉल में 30 मिनट संभालता है। ComfyUI में Wan 2.1 किसी भी लंबाई को टुकड़ों में प्रोसेस कर सकता है। आप "10 मिनट कैसे जनरेट करें" वाली समस्या से बिल्कुल भी नहीं जूझ रहे क्योंकि फ़ुटेज पहले से ही मौजूद है।

RealMaster (Meta / Tel Aviv University)

RealMaster एक रिसर्च सिस्टम है जो ख़ास तौर पर इस वर्कफ़्लो के लिए बनाया गया है। मार्च 2026 में Meta Reality Labs और Tel Aviv University द्वारा प्रकाशित, यह रेंडर किए गए 3D वीडियो को सोर्स के साथ पूरी ज्यामितीय अलाइनमेंट बनाए रखते हुए फ़ोटोरियलिस्टिक वीडियो में बदलता है। विधि 3D रेंडर से एज मैप्स निकालती है ताकि संरचना और मोशन सुरक्षित रहे, फिर बाकी सब कुछ फोटोरियलिस्टिक आउटपुट में बदलने के लिए एक वीडियो डिफ्यूजन मॉडल (VACE/Wan आर्किटेक्चर पर बना) लागू करती है। एक हल्का IC-LoRA एडाप्टर पूरे पाइपलाइन को एक ही इन्फरेंस पास में समेट देता है जिसे एंकर फ्रेम्स की जरूरत नहीं होती और जो सीक्वेंस के बीच में आने वाली वस्तुओं को भी संभाल लेता है।

GTA-V और CARLA सिमुलेटर सीक्वेंस पर टेस्ट किए जाने पर, RealMaster सामान्य-उद्देश्य वाले वीडियो एडिटिंग बेसलाइन्स से काफी बेहतर प्रदर्शन करता है। यह रियलिज्म ट्रांसफॉर्मेशन के ऊपर टेक्स्ट प्रॉम्प्ट के जरिए मौसम इफेक्ट्स भी जोड़ सकता है ("Make it rain", "Make it snow")। मॉडल बिना दोबारा ट्रेनिंग के सिमुलेटर्स में सामान्यीकृत होता है। GTA-V डेटा पर ट्रेन किए गए वेट्स बिना किसी अतिरिक्त ट्यूनिंग के CARLA आउटपुट पर काम करते हैं।

उपलब्धता: केवल रिसर्च के लिए। अभी कोई सार्वजनिक वेट्स या API नहीं है।

स्पेकमान
इनपुटरेंडर की गई 3D वीडियो (किसी भी इंजन से)
आउटपुटज्यामिति और मोशन को सुरक्षित रखने वाली फोटोरियलिस्टिक वीडियो
आर्किटेक्चरVACE/Wan वीडियो डिफ्यूजन बैकबोन पर IC-LoRA
कंडीशनिंगसोर्स रेंडर से एज मैप्स
टेस्ट किया गयाGTA-V, CARLA सिमुलेटर
लाइसेंसजारी नहीं (केवल रिसर्च पेपर)

आज उपलब्ध प्रोडक्शन V2V टूल्स

Element References के साथ Kling 3.0 V2V सबसे संपूर्ण प्रोडक्शन विकल्प है। fal.ai पर Edit Video और Reference V2V एंडपॉइंट्स 3-10 सेकंड के सोर्स वीडियो क्लिप्स को एलिमेंट रेफरेंस (@Element1, @Element2 फ्रंटल और मल्टी-एंगल फोटो के साथ) और एनहांसमेंट प्रॉम्प्ट के साथ स्वीकार करते हैं। मॉडल सोर्स में मोशन ट्रैजेक्टरी और कैमरा पैटर्न का विश्लेषण करता है, फिर मूल स्टेजिंग और कैमरा वर्क को सुरक्षित रखते हुए आपके निर्दिष्ट कैरेक्टर स्वरूप और विजुअल स्टाइल के साथ फुटेज को दोबारा जनरेट करता है। अधिकतम 7 रेफरेंस इनपुट। आउटपुट 1080p पर। अपने कटसीन को 10-15 सेकंड के हिस्सों में प्रोसेस करें और कैरेक्टर की निरंतरता बनाए रखने के लिए सभी हिस्सों में समान एलिमेंट रेफरेंस का उपयोग करें।

Lucy Restyle 2 एक ही API कॉल में इनपुट के प्रति सेकंड $0.01 की दर से 30 मिनट तक के सोर्स वीडियो को संभालता है। यह एक टेक्स्ट प्रॉम्प्ट और स्टाइल गाइडेंस के लिए एक वैकल्पिक रेफरेंस इमेज स्वीकार करता है। Kling की तरह प्रति-कैरेक्टर एलिमेंट रेफरेंस नहीं है, लेकिन पूर्ण-लंबाई वाले 3D रेंडर के समग्र सिनेमैटिक स्टाइल ट्रांसफर के लिए यह सबसे सरल और सस्ता रास्ता है। इसमें अपना पूरा रेंडर और लक्षित लुक बताने वाला प्रॉम्प्ट डालें। आउटपुट 720p पर हजारों फ्रेम्स में टेम्पोरल कंसिस्टेंसी के साथ।

ComfyUI में Wan 2.1 VACE ओपन-सोर्स रास्ता है। 14B VACE मॉडल रेफरेंस-चालित V2V करता है: इनपुट में एक सोर्स वीडियो प्लस एक स्टाइल रेफरेंस इमेज, आउटपुट में संरचना और मोशन को सुरक्षित रखने वाला रीस्टाइल किया गया वर्जन। एज मैप कंडीशनिंग संरचनात्मक सटीकता को बेहतर बनाती है। आप एक प्रोसेसिंग लूप बना सकते हैं जो किसी भी लंबाई को हिस्सों में, स्थिर स्टाइल रेफरेंस के साथ संभाले। मुफ्त, आपके अपने हार्डवेयर पर लोकली चलता है।

Grok Imagine V2V रेफरेंस मोड में सोर्स वीडियो के साथ 1-7 रेफरेंस इमेज स्वीकार करता है। 720p पर प्रति सेकंड $0.05। रेफरेंस मोड और फर्स्ट-फ्रेम मोड के बीच स्पष्ट विभाजन का मतलब है कि आपके रेफरेंस कैरेक्टर के स्वरूप को गाइड करते हैं बिना सोर्स वीडियो की संरचना को ओवरराइड किए।

आपके 3D रेंडर को क्या चाहिए

रेंडर क्वालिटी की न्यूनतम सीमा मायने रखती है। एक साधारण वायरफ्रेम V2V मॉडल को काम करने के लिए पर्याप्त नहीं देगा। लेकिन आपको प्रोडक्शन-क्वालिटी मैटेरियल या लाइटिंग की भी जरूरत नहीं है।

सही प्रोपोर्शन और ज्यामिति। रेफरेंस इमेज को ठीक से मैप करने के लिए कैरेक्टर मॉडल्स को लगभग सही बॉडी प्रोपोर्शन और चेहरे की संरचना चाहिए। सही प्रोपोर्शन वाली बेसिक ह्यूमनॉइड ज्यामिति पर्याप्त है। एक स्टिक फिगर पहचानने योग्य कैरेक्टर नहीं बना पाएगा।

बेसिक लाइटिंग डायरेक्शन। सीन की समग्र रोशनी स्थापित करने वाली एक सिंगल डायरेक्शनल लाइट मॉडल को इच्छित मूड समझने में मदद करती है। AI विवरण जोड़ेगा और बेहतर बनाएगा, लेकिन उसे यह जानना जरूरी है कि सीन तेज दिनदहाड़े का है या अंधेरे इंटीरियर का।

स्मूद कैमरा मोशन। स्थिर, सोच-समझकर किए गए कैमरा मूव अच्छे से ट्रांसलेट होते हैं। अनियमित या अत्यधिक तेज मोशन V2V मॉडल्स को भ्रमित कर सकता है। अपने वर्चुअल कैमरे को वास्तविक कैमरे की तरह ही व्यवहार करने दें।

वायरफ्रेम की बजाय फ्लैट शेडिंग। वायरफ्रेम या बिना टेक्सचर वाले मॉडल्स की तुलना में सिंपल फ्लैट-शेडेड या लो-पॉली ज्यामिति बेहतर परिणाम देती है। सतहों पर बेसिक ठोस रंग भी मॉडल को मैटेरियल सीमाएं समझने में मदद करते हैं।

लागत और स्केल

अलग-अलग टूल्स से 10 मिनट के कटसीन को प्रोसेस करना:

टूलअधिकतम इनपुट लंबाई10 मिनट के लिए लागतरिजॉल्यूशनरेफरेंस इमेज
Kling O3 V2V10s क्लिप्स~$50-671080pअधिकतम 7 (एलिमेंट्स + स्टाइल)
Lucy Restyle 230 मिनट$6720p1 (केवल स्टाइल)
Grok Imagine V2V10s क्लिप्स~$30720p1-7
Wan 2.1 VACEकोई भी (हिस्सों में)मुफ्त (लोकल GPU)720pप्रति हिस्सा 1

ये आंकड़े मध्य-2026 में तुलना पहली बार करते समय वेंडर की लिस्ट कीमतों पर आधारित हमारे अनुमान हैं, और वेंडर अक्सर कीमतें बदलते रहते हैं, इसलिए इन्हें एक सटीक उद्धरण के बजाय सापेक्ष रैंकिंग के रूप में लें। पूर्ण-लंबाई प्रोसेसिंग के लिए Lucy Restyle सबसे सस्ता है। एलिमेंट रेफरेंस के साथ कैरेक्टर-विशिष्ट एनहांसमेंट के लिए Kling सबसे सटीक है। अगर आपके पास हार्डवेयर है तो Wan 2.1 मुफ्त है (720p पर 14B मॉडल के लिए लगभग 60GB VRAM चाहिए, या कम क्वालिटी पर 1.3B वेरिएंट के लिए 8GB)।

तुलना तालिका

मॉडलअधिकतम नेटिव अवधिविस्तारित अवधिरेफरेंस प्रकारअधिकतम रेफरेंसरिजॉल्यूशनAPI उपलब्धओपन सोर्स
LongCat Video~15 मिनटलागू नहींकेवल फर्स्ट-फ्रेम1720p/30fpsहाँ (fal.ai)हाँ (MIT)
Seaweed APT2~5 मिनटलागू नहींI2V + पोज़1720pनहींनहीं
Heliosमिनट-स्केललागू नहींफर्स्ट-फ्रेम (I2V)1720pHF Spacesहाँ (Apache 2.0)
SkyReels V3असीमितलागू नहींसच्चा रेफरेंस1-4720pनहींहाँ
Kling 3.015s~3 मिनटएलिमेंट्स + स्टाइल रेफरेंस71080pहाँनहीं
Grok Imagine15sचेन-योग्यसच्चा रेफरेंस7720pहाँनहीं
Seedance 2.015sलागू नहींमल्टी-मॉडल रेफरेंस122Kहाँनहीं
Seedance 2.530sमल्टी-राउंड विस्तारमल्टी-मॉडल रेफरेंस502Kहाँ (BytePlus, Runway)नहीं
Vidu Q316sलागू नहींसच्चा रेफरेंस71080pहाँनहीं
MiniMax H315sलागू नहींमल्टी-मॉडल रेफरेंस122Kहाँहाँ (कम्युनिटी लाइसेंस)
Runway Gen-4.510s~1 मिनटI2V (0-1)11080pहाँनहीं
Veo 3.18s~2.5 मिनटIngredients (स्टाइल)34Kहाँनहीं
Gemini Omni Flash10sसंवादात्मक एडिट + विस्तार (1.1)मल्टीमॉडल रेफरेंसइमेज + वीडियो720pहाँ (GA)नहीं
Sora 2 Pro ⚠️ बंद हो रहा है20sचेन-योग्यकैरेक्टर ID (वीडियो)21080pAPI सितंबर 2026 में बंद होगानहीं
Hailuo 0210sलागू नहींI2V (फर्स्ट-फ्रेम)11080pहाँनहीं
Luma Ray3.220sलागू नहींकीफ्रेम + कैरेक्टर रेफरेंस16 कीफ्रेम1080p (4K अपस्केल)हाँनहीं
Pika 2.510s25sPikascenes101080pहाँनहीं
Wan 2.1 / 2.2छोटे क्लिप्सनिरंतरता के जरिएI2V / FLF2V1-2720pfal.ai के जरिएहाँ (Apache 2.0)
Wan 3.030sलागू नहींमल्टी-मॉडल रेफरेंसइमेज, वीडियो, ऑडियो1080pहाँ (Alibaba Cloud)नहीं
HunyuanVideoछोटे क्लिप्सनिरंतरता के जरिएI2V (फर्स्ट-फ्रेम)1720pfal.ai के जरिएहाँ
LTX-2.320sनिरंतरता के जरिएI2V + कीफ्रेममल्टी-कीफ्रेम4Kहाँ (LTX, fal.ai)वेट्स (ARR-कैप्ड)
CogVideoX6-10sनिरंतरता के जरिएI2V (फर्स्ट-फ्रेम)1720x480fal.ai के जरिएहाँ

आगे क्या आ रहा है

2026 के दौरान का ट्रैजेक्टरी स्पष्ट है। LongCat Video ने साबित किया कि निरंतरता के साथ मिनट-स्केल जनरेशन एक ओपन मॉडल में संभव है। Helios ने दिखाया कि यह रियल-टाइम में हो सकता है। Seaweed APT2 ने इंटरैक्टिव लॉन्ग-फॉर्म जनरेशन का प्रदर्शन किया। और सच्चे-रेफरेंस मॉडल्स (Kling, Grok, Seedance) ने साबित किया कि कैरेक्टर आइडेंटिटी किसी भी सीन में बनी रह सकती है।

अगला कदम इन क्षमताओं को जोड़ना है: सच्चे कैरेक्टर रेफरेंस सपोर्ट के साथ नेटिव लॉन्ग-फॉर्म जनरेशन। अभी आपको एक या दूसरा चुनना पड़ता है। जब कोई मॉडल दर्जनों सीन बदलावों में रेफरेंस इमेज से कैरेक्टर बनाए रखते हुए 5 मिनट का वीडियो जनरेट कर सकेगा, तब चेन्ड-क्लिप्स वर्कफ्लो अप्रचलित हो जाएगा। Seedance 2.5 (नेटिव 30-सेकंड क्लिप्स, 50 रेफरेंस फाइल तक, 31 जुलाई 2026 को रिलीज़) और Wan 3.0 (मल्टीमॉडल रेफरेंस से 30-सेकंड की सिंगल टेक, अगस्त 2026) उस दिशा में पहले वास्तविक कदम हैं।

सितंबर 2026 की शुरुआत तक, Artificial Analysis text-to-video arena (ऑडियो सहित) में Google का Gemini Omni Flash और Alibaba का API-only Wan 3.0 शीर्ष पर बराबरी पर हैं (~1,239 Elo), MiniMax H3 Max और H3 कुछ अंक पीछे, फिर Seedance 2.0, Wan 2.7, HappyHorse मॉडल्स, Sand.ai का MAGI-2 प्रीव्यू, और Kling 3.0 Pro शीर्ष दस को पूरा करते हैं। लीडरबोर्ड अक्सर फेरबदल होता रहता है, इसलिए किसी भी एक रैंकिंग को स्थिर क्रम की बजाय एक स्नैपशॉट मानें। The 3D scaffold approach एक समानांतर दिशा प्रस्तुत करता है। जैसे-जैसे V2V मॉडल अपनी structural preservation और photorealism में सुधार करते हैं, low-fidelity 3D renders को enhance करना पूर्ण production के लिए तेजी से practical होता जा रहा है। Meta का RealMaster पहले से ही game engine output पर research-quality sim-to-real transformation हासिल कर चुका है। जब यह capability reference image support के साथ production APIs तक पहुंचेगी, तो basic 3D skills रखने वाला कोई भी व्यक्ति camera, staging, और character placement पर पूर्ण नियंत्रण के साथ किसी भी duration में photorealistic long-form video बना सकेगा।

फिलहाल, practical जवाब आपके use case पर निर्भर करता है:

Multi-character reference के लिए सबसे बेहतर: Kling 3.0 (अलग element + style system के साथ 7 refs तक), Seedance 2.5 (30-second take में 50 multimodal inputs तक), या Vidu Q3 (in-clip camera switching के साथ 7 tagged references)।

Reference-to-video के लिए सबसे बेहतर API: Grok Imagine (clean API, explicit reference mode, original model के लिए $0.05/sec), Vidu Q3 (@ tags, 7 refs), या fal.ai के जरिए Kling।

कई clips में persistent characters के लिए सबसे बेहतर: Kling 3.0 के element references या SkyReels V3 का reference-and-extend। (Sora 2 Pro का character-ID system सबसे clean approach था, लेकिन इसे 2026 में बंद किया जा रहा है, इसलिए इस पर नया काम शुरू न करें।)

सबसे बेहतर open source: SkyReels V3 (1-4 true reference images, unlimited length), MiniMax H3 (9 reference images के साथ video और audio, क्षेत्रीय application वाला community licence), या Helios (real-time, Apache 2.0)।

कच्चे duration के लिए सबसे बेहतर: LongCat Video (~15 मिनट, लेकिन केवल first-frame)।

3D render enhancement के लिए सबसे बेहतर: Kling 3.0 V2V (per-character element refs, 1080p) या Lucy Restyle 2 (30 मिनट input, $0.01/sec)।


आम सवाल

लंबे videos के लिए सबसे बेहतर AI video model कौन सा है?

कच्चे duration के लिए, LongCat Video native रूप से लगभग 15 मिनट generate करता है, हालांकि यह केवल first-frame है। consistent characters वाले लंबे video के लिए, 2026 में practical जवाब है reference-and-extend workflow: strong reference support वाले model (Kling 3.0, Runway Gen-4.5, या open-source SkyReels V3) से clips generate करें, फिर उन्हें chain करें। कोई भी single model न तो लंबा चलता है और न ही character identity को पूरी तरह बनाए रखता है, इसलिए ज़्यादातर production काम इन्हें मिलाकर किए जाते हैं।

कौन से AI video models reference images को support करते हैं?

Kling 3.0 Omni, Runway Gen-4.5, Seedance 2.0 और 2.5, Vidu Q3, MiniMax H3, Google Veo 3.1, और Gemini Omni Flash सभी commercial options में reference images को support करते हैं। open-source तरफ, SkyReels V2/V3, Wan 2.1 और 2.2, LTX-2.5, और open MiniMax H3 weights reference inputs स्वीकार करते हैं जिन्हें आप खुद run कर सकते हैं। support की quality काफी अलग-अलग होती है, यही कारण है कि ऊपर दी गई guide इन्हें tiers में बांटती है।

क्या AI लंबे video में consistent character generate कर सकता है?

हां, लेकिन एक ही shot में नहीं। भरोसेमंद तरीका है एक या अधिक reference images से character को lock करना, छोटे clips generate करना, और उन्हें extend या stitch करते हुए वही references वापस feed करना। true reference support (जहां model नए generations में identity बनाए रखता है) यहां first-frame conditioning से कहीं ज्यादा मायने रखता है, जो केवल opening frame को seed करता है।

first-frame और true reference image support में क्या अंतर है?

first-frame conditioning आपकी image को clip के literal opening frame के रूप में उपयोग करता है, फिर video आगे बढ़ने के साथ drift करने लगता है। true reference support image को एक identity anchor के रूप में treat करता है जिसे model पूरी generation में follow करता है, इसलिए कोई character या style पूरी clip में और अलग-अलग clips में भी consistent रहता है। ऊपर का section बताता है कि कौन से models क्या करते हैं।

Kling AI image to video multiple reference images के साथ कैसे काम करता है?

Kling का multi-image reference plain image-to-video से अलग एक mode है। एक picture को first frame के रूप में animate करने के बजाय, आप 7 images और elements तक upload करते हैं (यदि आप reference video भी attach करें तो 4), उन्हें prompt में @Image1 या @Element1 के रूप में tag करते हैं, और shot describe करते हैं। Elements ऐसे locked characters या objects होते हैं जो 4 angle photos तक या एक छोटी video clip से बनाए जाते हैं, वैकल्पिक रूप से एक bound voice के साथ, और ये Kling के multi-shot storyboard में बने रहते हैं। पूरे rules ऊपर के Kling section में हैं, सीधे Kuaishou की खुद की guide से।

Wan 2.2 का क्या? क्या Wan 2.5 या Wan 3.0 open source है?

Wan 2.2 (जुलाई 2025) सबसे नया Wan है जिसे आप download कर सकते हैं, एक Apache 2.0 Mixture-of-Experts release जिसमें 5B variant एक RTX 4090 पर चलता है और 14B text-to-video और image-to-video models हैं। Wan 2.5, 2.6, 2.7, और Wan 3.0 (अगस्त 2026, 1080p तक 30-second single takes) Alibaba Cloud के जरिए केवल API के रूप में उपलब्ध हैं, बिना public weights के, चाहे affiliate blogs कुछ भी कहें। अगर आप open weights पर reference-image workflow चाहते हैं, तो Wan 2.2 के image-to-video और first-last-frame models उपयोग करें, या SkyReels V3 और MiniMax H3 देखें।

image to video और reference to video में क्या अंतर है?

image to video आपके दी गई picture को animate करता है, इसलिए आपकी image opening frame होती है और model वहीं से आगे बढ़ता है। reference to video आपकी images को identity और style anchors के रूप में उपयोग करता है और आपके prompt से एक नया shot generate करता है, इसलिए एक studio में photograph किया गया character जंगल में चलता हुआ दिखाई दे सकता है। एक finished still को animate करने के लिए image to video सही है। consistent character वाली multi-scene stories के लिए reference to video सही है। Kling, Vidu Q3, Seedance, Grok Imagine, और MiniMax H3 दोनों modes offer करते हैं, और Vidu तथा Grok उन्हें अपने APIs में स्पष्ट रूप से label करते हैं।

कौन से AI video models कई clips में same subject बनाए रखते हैं (subject reference)?

कई clips में subject या character reference के लिए, सितंबर 2026 तक सबसे मजबूत options हैं Kling 3.0 Omni (multi-angle photos और voice वाली element library), Seedance 2.5 (50 references और 30-second takes तक), Vidu Q3 (7 tagged subjects), और MiniMax H3 (9 reference images के साथ video और audio)। Luma Ray3 एक Character Reference feature जोड़ता है और Sora 2 Pro के character IDs सबसे clean system थे, लेकिन Sora का API 24 सितंबर, 2026 को बंद हो जाएगा। open weights पर, SkyReels V3 और MiniMax H3 ही वो हैं जिनमें true subject reference है।


संबंधित

अभी आज़माएँScene को render करने के बजाय playable बनाएं

Render queue को छोड़ें, इसे live drive करें।

मुफ़्त में बनाएँ →मुफ़्त है, ब्राउज़र में चलता है, कुछ इंस्टॉल नहीं करना।