FLUX 3 ने इमेज, वीडियो, ऑडियो और रोबोट की क्रियाओं को एक ही मॉडल में समेटा
Black Forest Labs ने 23 जुलाई को FLUX 3 जारी किया, और यह संस्करण संख्या से कहीं बड़ी छलांग है। Freiburg की इस लैब ने FLUX के दम पर अपनी पहचान बनाई—ये वही इमेज मॉडल हैं जो Photoshop, Canva, Picsart और, हमारे लिए अधिक प्रासंगिक रूप से, Cinevva में Flux प्रदाता चुनने वाले हर व्यक्ति के लिए कला तैयार करते हैं। FLUX 3 पहली बार है जब कंपनी ने वीडियो मॉडल पेश किया है, और उसने कोई अलग वीडियो मॉडल जारी नहीं किया। यह इमेज, वीडियो और ऑडियो पर एक साथ वेट्स के एक ही सेट को प्रशिक्षित करता है, फिर रोबोट की क्रियाओं का अनुमान लगाने के लिए उसी बैकबोन का विस्तार करता है। एक मॉडल, चार तरह के आउटपुट।
FLUX 3 Video क्या बनाता है, इसकी पहली झलक
एक बैकबोन, न कि जोड़कर बनाए गए चार उत्पाद
यह पेशकश उस शोध विचार पर आधारित है जिसे BFL Self-Flow कहता है: इमेज जनरेशन, वीडियो जनरेशन और ऑडियो जनरेशन को अलग-अलग समस्याओं के रूप में सीखने के बजाय, दुनिया कैसे काम करती है इसका एक साझा निरूपण सीखा जाए। इमेज किसी एक क्षण में स्थान का एक अंश होती है। वीडियो उसमें समय और गति जोड़ता है। ऑडियो किसी टक्कर और उससे पैदा होने वाली आवाज़ के बीच का कारणात्मक संबंध दिखाता है। इन सभी पर एक साथ प्रशिक्षण देने से उनकी बाधाएँ एक-दूसरे को मजबूत करती हैं, इसलिए ध्वनि को गति से मेल खाना पड़ता है और गति को भौतिकी के नियमों का पालन करना पड़ता है। लॉन्च में चौंकाने वाली बात यह है कि वीडियो की गुणवत्ता खराब किए बिना उसी बैकबोन से क्रिया का अनुमान लगाना संभव हो गया। इसी वजह से FLUX 3 समान वेट्स से रोबोटिक आर्म चला सकता है और म्यूज़िक वीडियो भी बना सकता है।
वीडियो की ठोस क्षमताएँ
FLUX 3 Video एक ही पास में 20 सेकंड तक लंबे क्लिप बनाता है, जिनमें दृश्य के साथ मूल ऑडियो भी तैयार होता है—संवाद, ध्वनि प्रभाव और परिवेशी आवाज़ें शामिल हैं। इसकी अवधि OpenAI के अब बंद हो चुके Sora के बराबर है और मौजूदा क्षेत्र के अधिकांश मॉडलों से लंबी है। यह टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो, वीडियो-टू-वीडियो, कीफ़्रेम ट्रांज़िशन, बहुभाषी संवाद और क्लिप को एजेंटिक तरीके से जोड़कर मल्टी-शॉट सीक्वेंस बनाने की क्षमता देता है। 10-सेकंड के 720p क्लिप पर BFL के अपने शुरुआती परीक्षणों में समीक्षकों ने 93% तुलनाओं में इसे Luma Ray 3.2 और 77% में Runway Gen-4.5 से बेहतर माना। सबसे मजबूत प्रतिद्वंद्वियों के मुकाबले अंतर लगभग सिक्का उछालने जितना रह जाता है: ByteDance के Seedance 2.0 और Google के Gemini Omni Flash, दोनों के मुकाबले 52%। ये लैब के अपने शुरुआती आँकड़े हैं, इसलिए इन्हें दावा मानें, अंतिम निर्णय नहीं।
लेकिन दिक्कत इसकी उपलब्धता है। FLUX 3 Video API और निजी वेट्स के ज़रिए सीमित अर्ली एक्सेस में है, और इसके लिए आवेदन करके मंज़ूरी लेनी होगी। FLUX 3 Action केवल साझेदारों के लिए उपलब्ध है और रोबोटिक्स स्टार्टअप mimic के माध्यम से Audi की एक वास्तविक उत्पादन लाइन पर इसका परीक्षण पहले से हो रहा है। FLUX 3 Image, जिसे अधिकांश डिज़ाइनर वास्तव में चाहते हैं, आने वाले हफ़्तों में उपलब्ध होगा। स्थानीय इन्फ़रेंस में रुचि रखने वाले समुदाय के लिए महत्वपूर्ण ओपन-वेट FLUX 3 Dev बैकबोन 2026 में बाद तक आने वाला नहीं है।
एक इमेज लैब का मल्टीमॉडल होना हमारे लिए क्यों मायने रखता है
हम BFL पर करीब से नज़र रखते हैं क्योंकि Cinevva पहले से ही उनकी तकनीक पर चलता है। जब दुनिया के सबसे बड़े रचनात्मक टूल्स में इस्तेमाल होने वाले इमेज मॉडल बनाने वाली दो प्रमुख लैब में से एक यह तय करती है कि उसका भविष्य एकीकृत वीडियो-ऑडियो-एक्शन मॉडल में है, तो यह केवल कोई नया खिलौना नहीं, बल्कि इस बात का संकेत है कि पूरी क्रिएशन टेक्नोलॉजी किस दिशा में जा रही है। “एक तस्वीर बनाओ,” “एक क्लिप बनाओ” और “ऐसी दुनिया का अनुकरण करो जिसमें आप कुछ कर सकें” के बीच की रेखा मिटकर एक ही मॉडल में समा रही है। यह वही अभिसरण है जिसे हमने दूसरी दिशा से आए MIRA वर्ल्ड मॉडल के साथ रेखांकित किया था।
क्रिएटर्स के लिए व्यावहारिक निष्कर्ष स्पष्ट है। बेहतर, लंबे और मूल ऑडियो वाले वीडियो मॉडल से पहले ड्राफ़्ट की लागत फिर घटती है, ठीक वैसे ही जैसे इससे पहले Seedance, Kling और Gemini ने किया था। लेकिन इससे वह हिस्सा आसान नहीं होता जो हमेशा कठिन था: यह जानना कि क्या बनाना सार्थक है, और फिर जनरेट किए गए क्लिप को बार-बार सुधारकर ऐसी चीज़ बनाना जिसे लोग वास्तव में देखना या खेलना चाहें। हम इसी प्रक्रिया के इर्द-गिर्द निर्माण करते रहते हैं—प्रॉम्प्ट से लेकर खुले वेब पर साझा करने, रीमिक्स करने और प्रकाशित करने तक। FLUX 3 कच्ची सामग्री को सस्ता और बेहतर बनाता है। उस सामग्री को ऐसे गेम या कहानी में बदलना जिसकी लोगों को परवाह हो, अब भी असली काम है।
संदर्भ
- Black Forest Labs: FLUX 3, वास्तविक दुनिया के मॉडल
- VentureBeat: Black Forest Labs ने FLUX 3 लॉन्च किया
- Decrypt: FLUX 3 ने स्थिर तस्वीरों को छोड़कर वीडियो और रोबोटिक हाथों का रुख किया
- The Decoder: Flux 3 मूल ऑडियो के साथ 20 सेकंड तक लंबे वीडियो बनाता है
- Black Forest Labs की प्रेस विज्ञप्ति (GlobeNewswire)