Black Forest Labs ने मल्टिमोडल व्हिडिओ मॉडेलसह प्रतिमांच्या पलीकडे विस्तार केला

Black Forest Labs ने Flux 3 सादर केले आहे, हे एक मल्टिमोडल फाउंडेशन मॉडेल आहे जे कंपनीच्या म्हणण्यानुसार प्रतिमा, व्हिडिओ आणि ऑडिओ एकत्र शिकते आणि प्रथमच स्थानिक आवाजासह व्हिडिओ क्लिप तयार करू शकते. ही लाँच जर्मन AI कंपनीसाठी एक उल्लेखनीय पाऊल आहे, जी नवीन प्रणालीला वास्तविक जगात घटना कशा उलगडतात याचे अधिक चांगले प्रतिनिधित्व करू शकणाऱ्या मॉडेल्सकडे व्यापक झेपेचा भाग म्हणून मांडत आहे.

कंपनीच्या वर्णनानुसार, Flux 3 समक्रमित ऑडिओसह 20 सेकंदांपर्यंत व्हिडिओ तयार करू शकते आणि text-to-video, image-to-video आणि video-to-video यांसह विविध generation mode ला समर्थन देते. यात keyframe-आधारित transition, बहुभाषिक संवाद, आणि स्वतंत्र क्लिप्सना लांब multi-shot sequence मध्ये जोडण्याची साधनेही आहेत.

या feature set मुळे Flux 3 AI बाजारातील गर्दीच्या आणि वेगाने बदलणाऱ्या भागात येते, जिथे model maker दृश्य सुसंगतता, भौतिक वास्तववाद आणि scene continuity सुधारण्यासाठी स्पर्धा करत आहेत. Native audio ची भर विशेषतः महत्त्वाची आहे, कारण अनेक व्हिडिओ प्रणाली अजूनही soundtrack generation, sound design किंवा speech synthesis साठी स्वतंत्र workflow वर अवलंबून असतात. एका पासमध्ये हालती चित्रे आणि आवाज दोन्ही तयार करू शकणारे मॉडेल, गुणवत्ता प्रत्यक्षात टिकली तर, उत्पादन पाइपलाइन सुलभ करू शकते.

Black Forest Labs मल्टिमोडल प्रशिक्षणावर भर का देत आहे

कंपनी Flux 3 ला फक्त व्हिडिओ जनरेटरपेक्षा अधिक म्हणून मांडते. तिचा युक्तिवाद असा आहे की प्रतिमा, व्हिडिओ आणि ऑडिओ वास्तवाचे वेगवेगळे भाग पकडतात, आणि प्रशिक्षणादरम्यान त्यांना एकत्र केल्यास मॉडेलला घटनांचे अधिक समृद्ध प्रतिनिधित्व तयार करण्यास मदत होऊ शकते. प्रतिमा स्थानिक तपशील देतात, व्हिडिओ कालगत बदल जोडतो, आणि ऑडिओ अशा cause-and-effect संकेतांना पकडू शकतो जे एका फ्रेममध्ये दिसत नाहीत.

हा तर्क व्यापक उद्योग चळवळीशी सुसंगत आहे, जी so-called world models कडे वळत आहे, म्हणजे अशी प्रणाली जी प्रत्येक माध्यमाला स्वतंत्रपणे न पाहता अनेक प्रकारच्या संवेदनात्मक माहितीवर reasoning करते. Black Forest Labs च्या मांडणीनुसार, multimodal training हे “real-world visual intelligence” कडे एक पाऊल आहे, म्हणजे भौतिक आणि डिजिटल वातावरणात जाणवू, अंदाज लावू आणि कृती करू शकणारी मॉडेल्स.

व्यावहारिक पातळीवर, कंपनीचे म्हणणे आहे की Flux 3 मानवी चेहऱ्यावरील भाव आणि दिसणाऱ्या भौतिक घटनांना आवाजाशी जुळवण्यात विशेषतः मजबूत आहे. जनरेटिव्ह व्हिडिओमध्ये या दोन्ही कठीण समस्या आहेत. चेहरे अनेकदा artifacts लवकर उघड करतात, आणि timing किंचितही चुकला तर audio-video synchronization immersion बिघडवते. हे दावे अंतर्गत चाचण्यांपलीकडे खरे ठरले, तर ते सध्याच्या AI video tools मधील दोन सर्वात दिसणाऱ्या कमकुवत बाजूंना संबोधित करतील.

Flux 3 व्हिडिओ मॉडेलसाठी सुरुवातीच्या वापरकर्ता पसंती दरांची आठ प्रतिस्पर्ध्यांशी तुलना. 50 टक्के गुण समता दर्शवतो. | Image: Black Forest Labs
Flux 3 व्हिडिओ मॉडेलसाठी सुरुवातीच्या वापरकर्ता पसंती दरांची आठ प्रतिस्पर्ध्यांशी तुलना. 50 टक्के गुण समता दर्शवतो. | Image: Black Forest Labs

बेंचमार्क दाव्यांमध्ये एक महत्त्वाची अट आहे

Black Forest Labs ने 10-सेकंद, 720p क्लिप्ससाठी सुरुवातीचे तुलना परिणामही शेअर केले. कंपनीने दिलेल्या त्या मूल्यांकनांमध्ये Flux 3 ला Luma Ray 3.2 विरुद्ध 93%, Runway Gen-4.5 विरुद्ध 77%, आणि Grok Imagine Video विरुद्ध 69% प्राधान्य मिळाले. अधिक मजबूत प्रतिस्पर्ध्यांविरुद्ध फरक बरेच कमी होते: Kling v3 Pro विरुद्ध 60%, Happy Horse v1 विरुद्ध 59%, Happy Horse 1.1 विरुद्ध 57%, आणि Seedance 2.0 तसेच Gemini Omni Flash दोन्हीविरुद्ध 52%.

ही आकडेवारी लाँचला लक्षवेधी बनवण्यासाठी पुरेशी आहे, पण स्पर्धात्मक चित्र निश्चित करण्यासाठी पुरेशी नाही. स्रोत सामग्री स्पष्टपणे नमूद करते की परिणाम प्राथमिक होते आणि प्रकाशनाच्या वेळी स्वतंत्र चाचण्या उपलब्ध नव्हत्या. कारण अंतर्गत preference study उपयुक्त संकेत देऊ शकतात, पण third-party benchmarking किंवा उत्पादन वातावरणातील व्यापक वापरकर्ता validation इतका आत्मविश्वास त्या देत नाहीत.

म्हणून ही लाँच एक गंभीर product move म्हणून वाचली पाहिजे, पण Flux 3 ने क्षेत्र मागे टाकले आहे याचा निर्णायक पुरावा म्हणून नाही. उपलब्ध माहितीद्वारे समर्थित अधिक मजबूत दावा मर्यादित आहे: Black Forest Labs ने कंपनी-निवेदित चाचण्यांत स्पर्धात्मक दिसणाऱ्या आणि एकात्मिक audio generation मुळे वेगळेपण दाखवणाऱ्या प्रणालीसह top-tier video-model चर्चेत प्रवेश केला आहे.

मीडिया generation पेक्षा अधिक: रोबोटिक्सचा कोन

Flux 3 सोबत Black Forest Labs ने Flux-mimic सादर केले, जे रोबोटिक्स अनुप्रयोगांसाठी उद्दिष्ट केलेले video action model म्हणून वर्णन केले आहे. कंपनीचे म्हणणे आहे की ही प्रणाली आधीच Audi मध्ये चाचणीसाठी वापरली जात आहे. त्या तपशिलामुळे लाँचचे धोरणात्मक महत्त्व वाढते.

जनरेटिव्ह AI बाबत अलीकडच्या सार्वजनिक लक्षाचा मोठा भाग सर्जनशील साधने, मनोरंजन, आणि जाहिरात workflow वर केंद्रित होता. एक media-generation model आणि रोबोटिक्स-केंद्रित action model यांची जोडी करून Black Forest Labs सूचित करत आहे की multimodal प्रणाली केवळ content creation साठीच नव्हे, तर embodied किंवा industrial applications साठीही उपयुक्त आहेत, जिथे visual understanding आणि action prediction महत्त्वाचे आहेत.

Flux 3 विशेष encoder आणि decoder असलेला multimodal transformer वापरतो; ते प्रतिमा, व्हिडिओ, ऑडिओ आणि actions साठी आहेत. त्याचा action component नवीन उपयोगांसाठी वाढवता येतो. | Image: Black Forest Labs
Flux 3 विशेष encoder आणि decoder असलेला multimodal transformer वापरतो; ते प्रतिमा, व्हिडिओ, ऑडिओ आणि actions साठी आहेत. त्याचा action component नवीन उपयोगांसाठी वाढवता येतो. | Image: Black Forest Labs

दोन्ही उत्पादनांमधील संबंध जितका व्यावसायिक आहे, तितकाच तो संकल्पनात्मकही आहे. motion, appearance आणि sound यांना परस्पर संबंधात आणण्यासाठी प्रशिक्षित केलेले मॉडेल, केवळ स्थिर प्रतिमांवर प्रशिक्षित मॉडेलपेक्षा भौतिक प्रक्रियांना अधिक चांगले समजू शकते. हे मजबूत रोबोटिक्स कामगिरीत रूपांतरित होते का, ते अजून पाहायचे आहे, पण कंपनीचे framing सूचित करते की ती अशा श्रेणीत स्पर्धा करू इच्छिते जिथे perception आणि control एकमेकांमध्ये मिसळू लागतात.

या लाँचमुळे आता काय बदलते

निर्माते आणि डेव्हलपर्ससाठी सर्वात तात्काळ परिणाम म्हणजे पर्यायांचा विस्तार. स्थानिक ऑडिओसह 20 सेकंदांपर्यंत व्हिडिओ generation, बहुभाषिक संवाद समर्थन आणि clip-chaining हे सर्व short-form storytelling, prototyping आणि कदाचित जाहिरात निर्मितीसाठी अधिक वापरण्यायोग्य workflow कडे निर्देश करतात. एकच मॉडेल जितक्या अधिक पायऱ्या आत्मसात करू शकते, तितके video generation, voice, sound effects आणि editing tools मधील manual stitching कमी लागते.

बाजारासाठी, ही release प्रतिस्पर्ध्यांवर audio ला नंतरचा विचार न मानता multimodal integration सुधारण्याचा दबाव वाढवते. तसेच video AI मधील पुढची स्पर्धात्मक आघाडी फक्त सुंदर फ्रेम्सची नसून motion, timing, speech आणि physical events या सर्वांमध्ये सुसंगतता टिकवू शकणाऱ्या प्रणालींची आहे, ही कल्पना बळकट करते.

त्याच वेळी, सावधगिरी आवश्यक आहे. दिलेला पुरावा अजून Flux 3 स्वतंत्र मूल्यांकनात कसे काम करते, प्रॉम्प्ट्समध्ये ते कितपत generalize करते, किंवा लांब किंवा अधिक गुंतागुंतीच्या दृश्यांमध्ये त्याची audio quality स्थिर राहते का, हे दाखवत नाही. हे प्रश्न ठरवतील की हे मॉडेल दीर्घकालीन उद्योग स्पर्धक ठरते की फक्त आणखी एक अल्पकालीन benchmark headline राहते.

मोठे चित्र

या caveat असूनही Flux 3 वेगळा दिसतो, कारण तो बाजार कोणत्या दिशेने जात आहे हे दर्शवतो. Video generation आता केवळ text मधून तयार झालेल्या शांत क्लिप्सबद्दल राहिलेले नाही. अधिक महत्त्वाकांक्षी लक्ष्य म्हणजे multimodal synthesis, जे कथा सांगणे, संवाद, आणि अखेरीस भौतिक-जगातील reasoning यांना समर्थन देण्यासाठी पुरेसे सुसंगत वर्तन करते.

Black Forest Labs चा युक्तिवाद आहे की पुढचा मार्ग प्रतिमा, व्हिडिओ आणि ऑडिओवरील संयुक्त प्रशिक्षणातून जातो. Flux 3 सह, कंपनीने ही भूमिका आज महत्त्व असलेल्या features आणि media पलीकडे जाणाऱ्या संशोधन महत्त्वाकांक्षांसह एका product शी जोडली आहे. परिणीती अजूनही क्षेत्रावर खात्रीशीर झेप नाही, पण AI च्या सर्वात स्पर्धात्मक क्षेत्रांपैकी एका ठिकाणी ही एक अर्थपूर्ण लाँच आहे.

हा लेख The Decoder च्या रिपोर्टिंगवर आधारित आहे. मूळ लेख वाचा.

Originally published on the-decoder.com