Black Forest Labs பல்மூல வீடியோ மாடலுடன் படங்களைத் தாண்டி விரிவடைகிறது

Black Forest Labs Flux 3-ஐ அறிமுகப்படுத்தியுள்ளது. இது ஒரு பல்மூல foundation model; இது படங்கள், வீடியோ மற்றும் ஆடியோவை ஒன்றாகக் கற்றுக்கொள்கிறது, மேலும் முதன்முறையாக உள்ளூர் ஒலியுடன் வீடியோ கிளிப்புகளை உருவாக்க முடியும் என்று நிறுவனம் கூறுகிறது. இந்த வெளியீடு ஜெர்மன் AI நிறுவனத்திற்கு ஒரு குறிப்பிடத்தக்க முன்னேற்றமாகும்; புதிய system-ஐ, நிஜ உலகில் நிகழ்வுகள் எப்படி unfold ஆகின்றன என்பதை சிறப்பாக பிரதிநிதித்துவப்படுத்தக்கூடிய மாடல்களுக்கான விரிவான முயற்சியின் ஒரு பகுதியாக அது நிலைநிறுத்துகிறது.

நிறுவனத்தின் விளக்கத்தின் படி, Flux 3 ஒத்திசைக்கப்பட்ட ஆடியோவுடன் 20 விநாடிகள் வரை வீடியோக்களை உருவாக்க முடியும், மேலும் text-to-video, image-to-video, video-to-video உட்பட பல generation mode-களை ஆதரிக்கிறது. இதில் keyframe-அடிப்படையிலான transition-கள், பலமொழி உரையாடல், மற்றும் தனிப்பட்ட கிளிப்புகளை நீளமான multi-shot sequence-களாக இணைக்கும் கருவிகளும் உள்ளன.

இந்த feature set, AI market-இன் நெரிசலான மற்றும் வேகமாக நகரும் ஒரு பகுதியில் Flux 3-ஐ நிறுத்துகிறது; அங்கு model maker-கள் visual coherence, physical realism, மற்றும் scene continuity-ஐ மேம்படுத்தப் போட்டியிடுகின்றனர். Native audio சேர்க்கப்படுவது குறிப்பாக முக்கியமானது, ஏனெனில் பல video system-கள் இன்னும் soundtrack generation, sound design, அல்லது speech synthesis-க்கு தனித்தனி workflow-களை நம்பியிருக்கின்றன. ஒரு pass-இல் நகரும் படங்களையும் ஒலியையும் உருவாக்கக்கூடிய model, தரம் நடைமுறையில் நிலைத்திருந்தால், production pipeline-களை எளிமைப்படுத்தலாம்.

Black Forest Labs ஏன் multimodal training-ஐ முன்னிலைப்படுத்துகிறது

நிறுவனம் Flux 3-ஐ வெறும் video generator-ஐ விட அதிகமாகக் காண்கிறது. அதன் வாதம் என்னவெனில், படங்கள், வீடியோ, ஆடியோ ஒவ்வொன்றும் நிஜத்தின் வெவ்வேறு பகுதிகளைப் பிடிக்கின்றன, மேலும் training-இன் போது அவற்றை இணைப்பது model-க்கு நிகழ்வுகளின் மேலும் செழுமையான representation-ஐ உருவாக்க உதவும். படங்கள் spatial detail-ஐ வழங்குகின்றன, video temporal change-ஐ சேர்க்கிறது, மற்றும் audio ஒரு single frame-இல் தெரியாத cause-and-effect cue-களைப் பிடிக்க முடியும்.

இந்த தர்க்கம் so-called world models என்ற பரந்த industry movement-உடன் ஒத்திருக்கிறது; அவை ஒவ்வொரு medium-ஐ தனித்தனியாகப் பார்க்காமல், பலவகை sensory information-ஐ கடந்து reason செய்யும் system-கள். Black Forest Labs-இன் formulation-இல், multimodal training என்பது “real-world visual intelligence” நோக்கி ஒரு படி; அதாவது physical மற்றும் digital environments-இல் உணர, கணிக்க, செயல்படக்கூடிய மாடல்கள்.

நடைமுறையில், மனித facial expressions-இல் மற்றும் காணக்கூடிய physical events-க்கு sounds-ஐப் பொருத்துவதில் Flux 3 குறிப்பாக வலுவாக இருப்பதாக நிறுவனம் கூறுகிறது. Generative video-வில் இந்த இரண்டும் கடினமான பிரச்சினைகள். Faces artifacts-ஐ விரைவாக வெளிப்படுத்தும், மேலும் timing சற்றே தவறினால்கூட audio-video synchronization immersion-ஐ உடைக்கிறது. இந்தக் கூறுகள் உள்நாட்டு சோதனைகளைத் தாண்டி நிரூபிக்கப்பட்டால், தற்போதைய AI video tools-இன் மிகத் தெளிவான இரண்டு பலவீனங்களை அவை சமாளிக்கும்.

Flux 3 வீடியோ மாடலுக்கான ஆரம்ப பயனர் விருப்ப விகிதங்கள் எட்டு போட்டியாளர்களுடன் ஒப்பிடப்பட்டுள்ளன. 50 சதவீத மதிப்பு சமநிலையை குறிக்கிறது. | Image: Black Forest Labs
Flux 3 வீடியோ மாடலுக்கான ஆரம்ப பயனர் விருப்ப விகிதங்கள் எட்டு போட்டியாளர்களுடன் ஒப்பிடப்பட்டுள்ளன. 50 சதவீத மதிப்பு சமநிலையை குறிக்கிறது. | Image: Black Forest Labs

Benchmark குறித்த கோரிக்கைகளுக்கு ஒரு முக்கிய எச்சரிக்கை உள்ளது

Black Forest Labs 10-விநாடி, 720p clips-க்கான ஆரம்ப comparison results-ஐயும் பகிர்ந்துள்ளது. நிறுவனம் அறிவித்த அந்த மதிப்பீடுகளில் Flux 3, Luma Ray 3.2-ஐவிட 93% சமயங்களில் முன்னுரிமை பெறப்பட்டது, Runway Gen-4.5-க்கு எதிராக 77%, Grok Imagine Video-க்கு எதிராக 69%. மேலும் வலுவான போட்டியாளர்களுக்கு எதிராக வேறுபாடு மிகக் குறைந்தது: Kling v3 Pro-க்கு எதிராக 60%, Happy Horse v1-க்கு எதிராக 59%, Happy Horse 1.1-க்கு எதிராக 57%, மற்றும் Seedance 2.0 மற்றும் Gemini Omni Flash இரண்டிற்கும் எதிராக 52%.

இந்த எண்கள் வெளியீட்டை குறிப்பிடத்தக்கதாக மாற்றினாலும், போட்டித் தளர்வை முடிவு செய்யும் அளவிற்கு போதுமானவை அல்ல. மூலப் பொருள் முடிவுகள் ஆரம்பநிலையவை என்றும், வெளியீட்டின் போது சுயாதீன சோதனைகள் எதுவும் கிடைக்கவில்லை என்றும் தெளிவாகக் குறிப்பிடுகிறது. ஏனெனில் உள்நாட்டு preference study-கள் பயனுள்ள சுட்டிக்காட்டுகளாக இருக்கலாம்; ஆனால் third-party benchmarking அல்லது production setting-களில் விரிவான user validation அளிக்கும் நம்பிக்கையை அவை தராது.

எனவே இந்த launch-ஐ ஒரு தீவிரமான product move ஆகப் பார்க்க வேண்டும்; Flux 3 துறையை முந்திவிட்டது என்பதற்கான இறுதி ஆதாரமாக அல்ல. கிடைக்கப்பெறும் தகவலால் ஆதரிக்கப்படும் வலுவான கூற்று இன்னும் குறுகியது: Black Forest Labs, நிறுவனம் அறிவித்த சோதனைகளில் போட்டித்தன்மை கொண்டதாகத் தோன்றும், மற்றும் integrated audio generation மூலம் வேறுபடக்கூடிய ஒரு system-உடன் top-tier video-model விவாதத்தில் நுழைந்துள்ளது.

மீடியா generation-ஐ விட அதிகம்: ரோபோட்டிக்ஸ் கோணம்

Flux 3-உடன் இணைந்து, Black Forest Labs Flux-mimic-ஐ அறிமுகப்படுத்தியுள்ளது; இது ரோபோட்டிக்ஸ் பயன்பாடுகளை நோக்கமாகக் கொண்ட video action model என்று விவரிக்கப்படுகிறது. இந்த system ஏற்கனவே Audi-இல் சோதனை செய்யப்படுவதாக நிறுவனம் கூறுகிறது. அந்த விவரம் இந்த launch-இன் மூலோபாய முக்கியத்துவத்தை விரிவுபடுத்துகிறது.

சமீபத்திய பொதுவான கவனம் பெரும்பாலும் generative AI-இன் creative tooling, entertainment, மற்றும் advertising workflows-இல் குவிந்துள்ளது. ஒரு media-generation model-ஐ robotics-oriented action model-உடன் இணைப்பதன் மூலம், Black Forest Labs multimodal system-கள் content creation-க்கு மட்டும் அல்ல, visual understanding மற்றும் action prediction முக்கியமான embodied அல்லது industrial பயன்பாடுகளுக்கும் பயனுள்ளதாக இருப்பதாகச் சுட்டிக்காட்டுகிறது.

Flux 3, images, video, audio, மற்றும் actions-க்கு தனித்தனியான encoders மற்றும் decoders கொண்ட ஒரு multimodal transformer-ஐ பயன்படுத்துகிறது. அதன் action component புதிய பயன்பாடுகளுக்காக விரிவுபடுத்தப்படலாம். | Image: Black Forest Labs
Flux 3, images, video, audio, மற்றும் actions-க்கு தனித்தனியான encoders மற்றும் decoders கொண்ட ஒரு multimodal transformer-ஐ பயன்படுத்துகிறது. அதன் action component புதிய பயன்பாடுகளுக்காக விரிவுபடுத்தப்படலாம். | Image: Black Forest Labs

இரு products-களுக்கிடையிலான இணைப்பு commercial-ஆகவும் conceptual-ஆகவும் இருக்கிறது. motion, appearance, sound-ஐ ஒன்றோடொன்று தொடர்புபடுத்தப் பயிற்சி பெற்ற model, நிலையான படங்களில் மட்டும் பயிற்சி பெற்ற model-ஐவிட physical processes-ஐ நன்கு புரிந்து கொள்ளக்கூடியதாக இருக்கலாம். அது வலுவான robotics performance-ஆக மாறுமா என்பது இன்னும் பார்க்க வேண்டியுள்ளது; ஆனால் நிறுவனத்தின் framing, perception மற்றும் control ஒன்றோடொன்று ஒட்டத் தொடங்கும் ஒரு category-இல் அது போட்டியிட விரும்புகிறது என்பதைக் காட்டுகிறது.

இப்போது இந்த launch என்ன மாற்றுகிறது

உருவாக்குநர்களுக்கும் developers-க்கும், உடனடியாகத் தெளிவாகத் தெரியும் விளைவு options-இன் விரிவாக்கம். உள்ளூர் ஆடியோவுடன் 20 விநாடிகள் வரை video generation, multilingual dialogue support, மற்றும் clip-chaining ஆகியவை short-form storytelling, prototyping, மற்றும் சாத்தியமான ad production-க்கு மேலும் பயன்படக்கூடிய workflows-ஐ நோக்கி சுட்டுகின்றன. ஒரு model எவ்வளவு அதிகமான படிகளை உள்வாங்க முடியுமோ, video generation, voice, sound effects, editing tools ஆகியவற்றுக்கிடையே manual stitching அவ்வளவு குறைவாகத் தேவைப்படும்.

Market-க்கு, இந்த release audio-வை பின்விளைவாகக் கருதாமல், multimodal integration-ஐ மேம்படுத்த வேண்டும் என்ற அழுத்தத்தை போட்டியாளர்கள்மீது அதிகரிக்கிறது. மேலும் video AI-இல் அடுத்த போட்டித் தளம் அழகான frames மட்டுமல்ல, motion, timing, speech, physical events ஆகியவற்றில் consistency-ஐப் பராமரிக்கக்கூடிய system-களும் என்பதையும் உறுதிப்படுத்துகிறது.

அதே நேரத்தில், எச்சரிக்கை தேவை. வழங்கப்பட்ட ஆதாரம் இன்னும் Flux 3 சுயாதீன மதிப்பீட்டில் எவ்வாறு செயல்படுகிறது, prompts முழுவதும் அது எவ்வளவு நன்றாக generalize செய்கிறது, அல்லது நீளமான அல்லது அதிக சிக்கலான scenes-இல் அதன் audio quality நிலைத்திருக்கிறதா என்பதை நிறுவவில்லை. இந்தக் கேள்விகளே இந்த model நீடித்த industry contender ஆகுமா அல்லது இன்னொரு குறுகியகால benchmark headline ஆகவே மிஞ்சுமா என்பதைத் தீர்மானிக்கும்.

பெரிய படம்

இந்த caveat-களுடன் கூட Flux 3 தனித்துவமாகத் தெரிகிறது, ஏனெனில் இது market எங்கு சென்று கொண்டிருக்கிறது என்பதை பிரதிபலிக்கிறது. Video generation இனி text-இல் இருந்து சேர்க்கப்பட்ட silent clips பற்றியது மட்டும் அல்ல. மேலும் பேராசையான இலக்கு என்பது narrative, interaction, மற்றும் இறுதியில் physical-world reasoning-ஐ ஆதரிக்கத் தக்க அளவுக்கு coherent-ஆக நடக்கும் multimodal synthesis ஆகும்.

அடுத்து செல்லும் பாதை images, video, audio மீது joint training வழியாகத்தான் என Black Forest Labs வாதிடுகிறது. Flux 3-உடன், அந்த thesis-ஐ இன்று முக்கியமான features-உடனும் media-ஐத் தாண்டிய research ambitions-உடனும் ஒரு product-க்கு நிறுவனம் இணைத்துள்ளது. இதன் விளைவு இன்னும் துறையை தாண்டிய verified leap அல்ல; ஆனால் AI-இன் மிகப் போட்டியான arenas-இல் ஒன்றில் இது ஒரு அர்த்தமுள்ள launch ஆகும்.

இந்தக் கட்டுரை The Decoder-இன் செய்திப்பதிவை அடிப்படையாகக் கொண்டது. மூலக் கட்டுரையைப் படிக்கவும்.

Originally published on the-decoder.com