ByteDance का Seedance 2.5 AI वीडियो को controllable बनाता है: 30s native 4K, 50 references, edit-in-place
ByteDance ने 23 जून को बीजिंग में अपने Volcano Engine FORCE कॉन्फ्रेंस में Seedance 2.5 को पेश किया। स्पेक शीट पर यह एक बड़ी छलांग है: एक ही लगातार 30-सेकंड की क्लिप, native 4K में 10-bit कलर और सिंक्रोनाइज़्ड ऑडियो के साथ, एक ही पास में जनरेट होती है। पर जो स्पेक असल में मायने रखता है वह रिज़ॉल्यूशन या लंबाई नहीं है। वह यह है कि अब आप इस चीज़ को डायरेक्ट कर सकते हैं। Seedance 2.5 हर जनरेशन में 50 तक multimodal references लेता है, तैयार क्लिप को दोबारा जनरेट करने के बजाय उसी जगह एडिट करने देता है, और रेंडर पर कमिट करने से पहले सीन को 3D में ब्लॉक कर देता है।
Seedance 2.5 ने क्या बदला, इस पर एक हैंड्स-ऑन नज़र
आंकड़े, संक्षेप में
Seedance 2.0 से छलांग असली है। सिंगल क्लिप कुछ सेकंड से बढ़कर 30 सेकंड लगातार हो गई। आउटपुट 1080p की सीमा से बढ़कर native 4K हो गया, 10-bit कलर के साथ, और यह कोई अपस्केल नहीं है। ऑडियो अब बाद में जोड़ने के बजाय वीडियो के साथ उसी latent पास में को-जनरेट होता है, इसलिए यह सच में सिंक करता है। और reference बजट करीब एक दर्जन इनपुट से बढ़कर 50 multimodal references हो गया, जिसमें इमेज, क्लिप, ऑडियो और स्टाइल मिलते हैं। ByteDance का कहना है कि इन सबके ऊपर prompt adherence करीब 20% बेहतर हुआ है।
ये capability के फायदे हैं। ये प्रभावशाली हैं, और एक साल पहले इनमें से हर एक अपने आप में पूरी कहानी होता। अब ये नहीं हैं।
Control ही नया फ्रंटियर है
दो साल तक AI वीडियो की दौड़ capability को लेकर थी। किसका मॉडल 4K करता है, किसका ऑडियो सिंक करता है, किसका किसी किरदार को कई शॉट में एक जैसा बनाए रखता है। वह दौड़ ज़्यादातर सुलझ चुकी। Kling 3.0 ने मार्च में ऑडियो के साथ 4K दिया, LTX 2.3 ने इसे open-source में किया, और फ्रंटियर मॉडल इतने करीब हैं कि उनके फर्क अब बहस भर हैं, कमियां नहीं। फिर बातचीत लागत पर आ गई, जहां distilled मॉडलों ने एक सेकंड वीडियो की कीमत 10x घटा दी।
Seedance 2.5 अगली धुरी की ओर इशारा करता है: control। तीन फीचर इसका पक्ष रखते हैं। पहला, तय जगह पर एडिटिंग। अगर 30-सेकंड के टेक में किसी किरदार के बालों का रंग गलत है, तो आप पूरी क्लिप दोबारा जनरेट करके अपनी पसंदीदा परफॉर्मेंस, एक्सप्रेशन और लाइटिंग गंवाने के बजाय बस उस हिस्से को ठीक करते हैं। दूसरा, 50 references। यह इतना है कि आप एक किरदार का चेहरा, एक सेट का लुक, एक prop, और एक मोशन स्टाइल सब एक साथ लॉक कर सकें, और यही तरीका है जिससे आपको स्लॉट मशीन के बजाय शॉट-दर-शॉट कंसिस्टेंसी मिलती है। तीसरा, एक 3D white-model previz स्टेप, जो आपको एक भी पूरा रेंडर खर्च करने से पहले सीन का लेआउट, कैमरा फ्रेमिंग और मोशन ब्लॉक करने देता है।
इन सबको मिलाकर, यह एक ऐसा मॉडल है जिसे आप सिर्फ prompt नहीं, बल्कि डायरेक्ट कर सकते हैं। "क्या यह कुछ खूबसूरत जनरेट कर सकता है" से "क्या आपको दूसरी कोशिश में ठीक वही चीज़ मिल सकती है जो आपने सोची थी" की ओर यह खिसकाव ही वह चीज़ है जो इन टूल्स को डेमो मशीन से प्रोडक्शन टूल में बदल देती है।
बिल्डरों के लिए इसका क्या मतलब है
अगर आप किसी प्रोडक्ट के अंदर वीडियो जनरेट करते हैं, तो इस रिलीज़ से तीन बातें निकलती हैं।
री-रोल की लागत हर generative वीडियो फीचर पर एक चुपचाप लगने वाला टैक्स थी। जब एक गलत डिटेल ठीक करने का इकलौता तरीका पूरी क्लिप दोबारा जनरेट करना और बाकी सब कुछ फिर से सही निकलने का दांव लगाना था, तब यूज़र बराबर मात्रा में क्रेडिट और सब्र दोनों जलाते थे। In-place एडिटिंग सीधे इसी पर वार करती है। जिसे बदलने के लिए आप भुगतान करते हैं वह इकाई पूरी क्लिप से घटकर एक हिस्सा रह जाती है।
References ही वह तरीका हैं जिससे आप कंसिस्टेंसी शिप करते हैं। एक किरदार जो दस शॉट में एक जैसा दिखे, एक सेट जो अपना लुक बनाए रखे, एक prop जो वही prop बना रहे। पचास reference स्लॉट इतने हैं कि इन्हें सच में पिन किया जा सके, और कंसिस्टेंसी ही वह चीज़ है जो एक इस्तेमाल-लायक asset पाइपलाइन को महज़ नयेपन से अलग करती है।
रेंडर से पहले previz वही सबक है जो लागत वाली कहानी ने सिखाया था, बस एक दूसरी दिशा से। महंगे 4K पास पर कमिट करने से पहले सीन को सस्ते 3D में ब्लॉक करने का मतलब है कि आप महंगी कंप्यूट उन टेक पर खर्च करते हैं जिन्हें आप पहले ही फ्रेम कर चुके हैं, न कि लॉटरी टिकटों पर।
Cinevva के लिए यही वह पैटर्न है जिस पर हम बार-बार दांव लगाते हैं। प्लेटफॉर्म में मौजूद जनरेशन टूल एक बिज़नेस के तौर पर तभी काम करते हैं जब क्रिएटर जो चाहते हैं वह जल्दी और सस्ते में पा सकें, एक चीज़ ठीक करने के लिए दर्जन बार री-रोल किए बिना। Capability जल्दी ही commoditize हो गई। लागत गिर रही है। Control, यानी सोच-समझकर ठीक वही नतीजा पाना, वहीं अगली पीढ़ी के काम के प्रोडक्ट जीते जाएंगे।
Seedance 2.5 अभी ग्लोबल एंटरप्राइज़ बीटा में है, और एक व्यापक पब्लिक लॉन्च जुलाई की शुरुआत के लिए तय है। US उपलब्धता की कोई टाइमलाइन अभी नहीं।
References
- The Next Web: ByteDance unveils Seedance 2.5, a 30-second native 4K AI video model that accepts 50 reference inputs
- Digital Applied: Seedance 2.5, ByteDance's 30-second AI video model
- MindStudio: Seedance 2.5, 30-second video, 4K, and 50 multimodal references explained
- Kie.ai: Seedance 2.5 release, what ByteDance just shipped