Black Forest Labs చిత్రాలను మించి మల్టీమోడల్ వీడియో మోడల్తో విస్తరిస్తోంది
Black Forest Labs Flux 3 ను పరిచయం చేసింది. ఇది చిత్రాలు, వీడియో మరియు ఆడియోలను కలిసి నేర్చుకుంటుందని, అలాగే మొదటిసారిగా నేటివ్ సౌండ్తో వీడియో క్లిప్లను రూపొందించగలదని కంపెనీ చెబుతున్న మల్టీమోడల్ ఫౌండేషన్ మోడల్. ఈ విడుదల జర్మన్ AI కంపెనీకి ఒక ముఖ్యమైన అడుగును సూచిస్తుంది, ఎందుకంటే వాస్తవ ప్రపంచంలో సంఘటనలు ఎలా పరిణమిస్తాయో మరింత బాగా ప్రతిబింబించే మోడళ్ల వైపు విస్తృత ప్రేరణలో భాగంగా కొత్త వ్యవస్థను స్థిరపరుస్తోంది.
కంపెనీ వివరణ ప్రకారం, Flux 3 సమకాలీకృత ఆడియోతో 20 సెకన్ల వరకు వీడియోలను రూపొందించగలదు, అలాగే text-to-video, image-to-video, video-to-video వంటి అనేక జనరేషన్ మోడ్లను మద్దతు ఇస్తుంది. ఇది కీఫ్రేమ్-ఆధారిత మార్పులు, బహుభాషా సంభాషణ, మరియు విడివిడిగా ఉన్న క్లిప్లను పొడవైన బహు-షాట్ క్రమాలుగా కలపడానికి సాధనాలను కూడా కలిగి ఉంది.
ఆ లక్షణాల సముదాయం Flux 3 ను AI మార్కెట్లో రద్దీగా, వేగంగా మారుతున్న ఒక విభాగంలో ఉంచుతుంది. అక్కడ మోడల్ తయారీదారులు దృశ్య సుసంగతం, భౌతిక వాస్తవికత, మరియు సన్నివేశ నిరంతరతను మెరుగుపరచడానికి పోటీ పడుతున్నారు. నేటివ్ ఆడియోను చేర్చడం ముఖ్యంగా ప్రాధాన్యం కలిగింది, ఎందుకంటే అనేక వీడియో వ్యవస్థలు ఇప్పటికీ సౌండ్ట్రాక్ తయారీ, సౌండ్ డిజైన్ లేదా స్పీచ్ సింథసిస్ కోసం వేరు వేరు వర్క్ఫ్లోలపై ఆధారపడుతున్నాయి. ఒకే పాస్లో కదులుతున్న దృశ్యాలు మరియు ధ్వనిని రెండింటినీ రూపొందించగల మోడల్, నాణ్యత ప్రాయోగికంగా నిలబడితే, ఉత్పత్తి పైప్లైన్లను సరళతరం చేయగలదు.
Black Forest Labs మల్టీమోడల్ శిక్షణపై ఎందుకు దృష్టి పెట్టుతోంది
కంపెనీ Flux 3 ను కేవలం వీడియో జనరేటర్గా మాత్రమే చూడటం లేదు. దాని వాదన ఏమిటంటే, చిత్రాలు, వీడియో, ఆడియో ప్రతి ఒక్కటి వాస్తవంలోని వేర్వేరు భాగాలను పట్టుకుంటాయి, మరియు వాటిని శిక్షణ సమయంలో కలపడం ద్వారా మోడల్ సంఘటనల గురించి మరింత సమృద్ధిగా ప్రతినిధిత్వాన్ని నిర్మించగలదని. చిత్రాలు స్థలిక వివరాలను ఇస్తాయి, వీడియో కాలానుగుణ మార్పును జోడిస్తుంది, ఆడియో ఒక్క ఫ్రేమ్లో కనిపించని కారణ-ఫలిత సంకేతాలను పట్టుకోగలదు.
ఆ తర్కం అనేక ఇంద్రియ సమాచార రూపాలపై ఆలోచించడానికి రూపొందిన, ప్రతి మాధ్యమాన్ని వేరుగా పరిగణించని వ్యవస్థలైన so-called ప్రపంచ మోడళ్ల వైపు పరిశ్రమలో పెరుగుతున్న ఉద్యమంతో సరిపోతుంది. Black Forest Labs భావనలో, మల్టీమోడల్ శిక్షణ “real-world visual intelligence” వైపు ఒక అడుగు, అంటే భౌతిక మరియు డిజిటల్ వాతావరణాల్లో గ్రహించగల, అంచనా వేయగల, చర్య తీసుకోగల మోడళ్లు.
ప్రాయోగికంగా చూస్తే, Flux 3 మానవ ముఖాభినయాల్లో, అలాగే కనిపించే భౌతిక సంఘటనలకు ధ్వనులను సరిపోల్చడంలో ప్రత్యేకంగా బలంగా ఉందని కంపెనీ చెబుతోంది. ఇవి రెండూ జనరేటివ్ వీడియోలో కఠినమైన సమస్యలు. ముఖాలు సాధారణంగా లోపాలను త్వరగా బయటపెడతాయి, మరియు సమయం కొద్దిగా తప్పినా ఆడియో-వీడియో సమన్వయం మునిగిపోయే అనుభూతిని చెడగొడుతుంది. అంతర్గత పరీక్షలకన్నా మించి ఈ వాదనలు నిజమైతే, అవి ప్రస్తుత AI వీడియో సాధనాల్లో అత్యంత స్పష్టంగా కనిపించే రెండు బలహీనతలను పరిష్కరించగలవు.

బెంచ్మార్క్ వాదనలకు ముఖ్యమైన హెచ్చరిక ఉంది
Black Forest Labs 10-సెకన్ల, 720p క్లిప్ల కోసం ప్రారంభ తులనాత్మక ఫలితాలను కూడా పంచుకుంది. కంపెనీ తెలిపిన మూల్యాంకనాల్లో Flux 3, Luma Ray 3.2 పై 93% పోలికల్లో, Runway Gen-4.5 పై 77%, మరియు Grok Imagine Video పై 69% లో ప్రాధాన్యం పొందింది. బలమైన ప్రత్యర్థులపై మార్జిన్లు చాలా సన్నగా ఉన్నాయి: Kling v3 Pro పై 60%, Happy Horse v1 పై 59%, Happy Horse 1.1 పై 57%, మరియు Seedance 2.0, Gemini Omni Flash రెండింటిపైనా 52%.
ఆ సంఖ్యలు విడుదలను ప్రాధాన్యం కలిగినదిగా చూపేందుకు సరిపోతాయి, కానీ పోటీ దృశ్యాన్ని తేల్చేయడానికి మాత్రం సరిపోవు. మూల పదార్థం స్పష్టంగా ఈ ఫలితాలు ప్రాథమికమైనవని, ప్రచురణ సమయంలో స్వతంత్ర పరీక్షలు అందుబాటులో లేవని చెబుతోంది. ఇది ముఖ్యమైనది, ఎందుకంటే అంతర్గత అభిరుచి అధ్యయనాలు ఉపయోగకరమైన సూచకాలు కావచ్చు, కానీ మూడవ పక్ష బెంచ్మార్కింగ్ లేదా ఉత్పత్తి వాతావరణాల్లో విస్తృత వినియోగదారుల ధృవీకరణతో సమానమైన విశ్వాస స్థాయిని ఇవ్వవు.
అందువల్ల ఈ ప్రారంభాన్ని ఒక గంభీరమైన ఉత్పత్తి అడుగుగా చదవాలి, కానీ Flux 3 రంగాన్ని దాటిపోయిందనే తుది రుజువుగా కాదు. అందుబాటులో ఉన్న సమాచారంతో మద్దతు పొందే బలమైన వాదన మరింత పరిమితమైనది: కంపెనీ నివేదించిన పరీక్షల్లో పోటీగా కనిపించే, మరియు సమగ్ర ఆడియో జనరేషన్తో భిన్నంగా నిలిచే ఒక వ్యవస్థతో Black Forest Labs అగ్రశ్రేణి వీడియో-మోడల్ చర్చలోకి ప్రవేశించింది.
మీడియా జనరేషన్ కంటే ఎక్కువ: రోబోటిక్స్ కోణం
Flux 3 తో పాటు, Black Forest Labs Flux-mimic ను కూడా పరిచయం చేసింది. ఇది రోబోటిక్స్ అనువర్తనాల కోసం ఉద్దేశించిన వీడియో యాక్షన్ మోడల్గా వర్ణించబడింది. ఈ వ్యవస్థను ఇప్పటికే Audi వద్ద పరీక్షిస్తున్నామని కంపెనీ చెబుతోంది. ఆ వివరము ఈ ప్రారంభానికి వ్యూహాత్మక ప్రాధాన్యాన్ని విస్తరిస్తుంది.
జనరేటివ్ AIలో ఇటీవలి ప్రజా దృష్టిలో ఎక్కువ భాగం సృజనాత్మక సాధనాలు, వినోదం, ప్రకటన వర్క్ఫ్లోలపై కేంద్రీకృతమైంది. మీడియా-జనరేషన్ మోడల్ను రోబోటిక్స్-ఆధారిత యాక్షన్ మోడల్తో జతచేయడం ద్వారా, Black Forest Labs మల్టీమోడల్ వ్యవస్థలు కేవలం కంటెంట్ సృష్టికే కాకుండా, దర్శన అవగాహన మరియు చర్య అంచనా ముఖ్యమైన embodiment లేదా industrial అనువర్తనాల్లో కూడా ఉపయోగపడతాయని సంకేతం ఇస్తోంది.

ఈ రెండు ఉత్పత్తుల మధ్య సంబంధం వాణిజ్యపరంగా ఎంతైతే ఉందో, భావనాత్మకంగానూ అంతే. కదలిక, రూపం, శబ్దం మధ్య సంబంధాన్ని నేర్చుకున్న మోడల్, కేవలం స్థిర చిత్రాలపై శిక్షణ పొందిన మోడల్తో పోలిస్తే భౌతిక ప్రక్రియలను అర్థం చేసుకోవడానికి మరింత అనుకూలంగా ఉండవచ్చు. అది స్థిరమైన రోబోటిక్స్ పనితీరుగా మారుతుందా లేదా అనేది ఇంకా చూడాలి, కానీ కంపెనీ ఉంచిన ఫ్రేమింగ్ ప్రకారం, గ్రహణం మరియు నియంత్రణ కలిసే ఒక వర్గంలో పోటీ పడాలని అది కోరుకుంటోంది.
ఇప్పుడు ఈ ప్రారంభం ఏమి మారుస్తోంది
సృష్టికర్తలు మరియు డెవలపర్లకు, అత్యంత స్పష్టమైన తక్షణ ప్రభావం ఎంపికల విస్తరణ. 20 సెకన్ల వరకు నేటివ్-ఆడియో వీడియో జనరేషన్, బహుభాషా సంభాషణ మద్దతు, మరియు క్లిప్లను కలిపే సామర్థ్యం చిన్న-ఫార్మ్ కథనాలు, ప్రోటోటైపింగ్, మరియు బహుశా ప్రకటన ఉత్పత్తికి మరింత ఉపయోగకరమైన వర్క్ఫ్లోల వైపు సూచిస్తున్నాయి. ఒకే మోడల్ ఎంత ఎక్కువ దశలను గ్రహించగలిగితే, వీడియో జనరేషన్, వాయిస్, సౌండ్ ఎఫెక్ట్స్, మరియు ఎడిటింగ్ సాధనాల మధ్య అంత మాన్యువల్ జత చేయడం అవసరం తగ్గుతుంది.
మార్కెట్ దృష్టిలో, ఈ విడుదల ప్రత్యర్థులు ఆడియోను ఆలోచన తర్వాతి అంశంగా కాకుండా మల్టీమోడల్ సమగ్రతను మెరుగుపరచాల్సిన ఒత్తిడిని పెంచుతుంది. అలాగే వీడియో AIలో తదుపరి పోటీ సరిహద్దు కేవలం మరింత అందమైన ఫ్రేమ్లు మాత్రమే కాదని, కదలిక, సమయనిర్ణయం, మాట, మరియు భౌతిక సంఘటనలపై స్థిరత్వాన్ని నిలుపుకోగల వ్యవస్థలేనని ఈ భావనను బలపరుస్తుంది.
అదే సమయంలో జాగ్రత్త అవసరం. అందించిన ఆధారాలు ఇంకా Flux 3 స్వతంత్ర మూల్యాంకనంలో ఎలా పనిచేస్తుందో, ప్రాంప్ట్ల across ఎంత బాగా సాధారణీకరిస్తుందో, లేదా దీని ఆడియో నాణ్యత పొడవైన లేదా సంక్లిష్ట సన్నివేశాల్లో స్థిరంగా ఉంటుందో నిర్ధారించవు. ఈ ప్రశ్నలు మోడల్ దీర్ఘకాలిక పరిశ్రమ పోటీదారుగా మారుతుందా, లేక తాత్కాలిక బెంచ్మార్క్ శీర్షికగా మిగులుతుందా అనే దాన్ని నిర్ణయిస్తాయి.
పెద్ద చిత్రం
ఈ హెచ్చరికలున్నప్పటికీ, Flux 3 మార్కెట్ దిశను ప్రతిబింబిస్తున్నందున ప్రత్యేకంగా నిలుస్తోంది. వీడియో జనరేషన్ ఇకపై టెక్స్ట్ నుండి తయారయ్యే నిశ్శబ్ద క్లిప్ల గురించే కాదు. మరింత ఆశావహ లక్ష్యం మల్టీమోడల్ synthesis, అది కథనాన్ని, పరస్పర చర్యను, చివరికి భౌతిక ప్రపంచ తర్కాన్ని మద్దతు ఇవ్వగలంత సమగ్రంగా ప్రవర్తించాలి.
చిత్రాలు, వీడియో, ఆడియోపై సంయుక్త శిక్షణ ద్వారా ముందుకు వెళ్లాలని Black Forest Labs వాదిస్తోంది. Flux 3 తో, అది ఆ సిద్ధాంతాన్ని నేటి అవసరాలకు తగిన లక్షణాలు, మరియు మీడియాకు మించి వెళ్లే పరిశోధనా ఆశయాలతో కూడిన ఉత్పత్తితో జత చేసింది. ఫలితం ఇప్పటికీ రంగాన్ని మించిపోయిన ధృవీకరించిన దూకుడు కాదు, కానీ AI యొక్క అత్యంత పోటీగల రంగాల్లో ఒకటైన ఈ విభాగంలో ఇది ప్రాముఖ్యమైన విడుదల.
ఈ వ్యాసం The Decoder నివేదిక ఆధారంగా రూపొందించబడింది. అసలు వ్యాసాన్ని చదవండి.
Originally published on the-decoder.com

