पुनरावृत्तीपूर्ण संपादनाकडे संगीत निर्मितीला Google ढकलत आहे

Google ने आपल्या संगीत निर्मिती मॉडेलची नवीनतम आवृत्ती Lyria 3.5 जारी केली आहे आणि तिला Flow Music मधील नवीन संपादन नियंत्रणांसोबत जोडले आहे. हे अपडेट केवळ कच्च्या निर्मितीपुरते महत्त्वाचे नाही, तर जनरेटिव्ह ऑडिओ साधने कोणत्या दिशेने जात आहेत याचेही सूचक आहे: ती एकदाच तयार करण्याच्या पद्धतीपासून सॉफ्टवेअरप्रमाणे पुनरावृत्तीने सुधारणा करण्याच्या कार्यप्रवाहांकडे वळत आहेत.

Google नुसार, Lyria 3.5 अधिक नैसर्गिक वाटणाऱ्या धून, सुधारित गीतलेखन, आणि अधिक स्पष्ट उच्चारांसह अधिक वास्तववादी आवाज देते. कंपनी असेही सांगते की आता वापरकर्त्यांना टेम्पो आणि ट्रॅकच्या लांबीवर अधिक सूक्ष्म नियंत्रण मिळेल, आणि तयार होणारे तुकडे 30 सेकंदांपासून तीन मिनिटांपर्यंत असतील. ही सुधारणा महत्त्वाची आहे, पण अधिक परिणामकारक भर Selective Section Painting हे वैशिष्ट्य ठरू शकते, जे वापरकर्त्यांना संपूर्ण ट्रॅक पुन्हा सुरुवातीपासून बांधण्याऐवजी फक्त काही भागांमध्ये बदल करण्यास परवानगी देते.

हा बदल जनरेटिव्ह मीडिया प्रणालींच्या एका सततच्या कमकुवत बाजूवर उपाय करतो. त्या अनेकदा विश्वासार्ह पहिला मसुदा तयार करू शकतात, पण वापरकर्त्याला अगदी विशिष्ट दुरुस्ती हवी असेल तेव्हा त्या कमी उपयुक्त ठरतात. जर कोरस काम करत असेल पण व्हर्स नसेल, किंवा बीट योग्य बसत असेल पण वोकल फ्रेसिंग चुकत असेल, तर संपूर्ण रचना पुन्हा सुरू करणे अप्रभावी ठरते. वापरकर्त्यांना स्थानिक पातळीवर हस्तक्षेप करता येईल अशी प्रणाली केवळ नवलाई जनरेटरसारखी न दिसता सर्जनशील निर्मिती साधनासारखी दिसू लागते.

प्रॉम्प्ट आउटपुटपासून संपादनक्षम रचनेपर्यंत

Selective Section Painting AI संगीत इंटरफेसमधील एका नव्या टप्प्याची सूचना देते. गाण्याला एक अखंड, अविभाज्य आउटपुट मानण्याऐवजी, मॉडेल ते भागनिहाय संपादित करता येणारी गोष्ट मानते. हे संगीतकार, निर्माते आणि साउंड डिझायनर प्रत्यक्षात जसे काम करतात त्याच्याशी जुळते. एखादा भाग बदलायचा आहे म्हणून ते पूर्ण मसुदा क्वचितच फेकून देतात. ते टायमिंग सुधारतात, भाग पुन्हा लिहितात, वाद्यरचना बदलतात, आणि फक्त न चालणारा भागच पुन्हा उभारतात.

Google म्हणते की ही प्रणाली छोट्या धूनांना संपूर्ण गाण्यांमध्ये रूपांतरित करू शकते, तेही पूर्ण रीस्टार्टची सक्ती न करता. प्रत्यक्षात याचा अर्थ असा की वापरकर्ता एखादी कल्पना रेखाटू शकतो, आणि नंतर आधीच चालत असलेले भाग जपत ती निवडकरीत्या विस्तारू शकतो. वोकल्स, ड्रम्स, बास आणि इतर घटकांवर टेम्पो आणि कालावधी अधिक अचूकपणे नियंत्रित करण्यासह, हे अपडेट निर्माता आणि मॉडेल यांच्यात अधिक मॉड्युलर नात्याकडे निर्देश करते.

ही मॉड्युलॅरिटी व्यावसायिक दृष्ट्या महत्त्वाची आहे. जनरेटिव्ह साधने प्रत्यक्ष सर्जनशील कार्यप्रवाहात अधिक चांगल्या प्रकारे बसतात, जेव्हा ती पुनरावृत्तीला आधार देतात. केवळ पूर्ण तयार कलाकृती देणारे मॉडेल डेमोमध्ये प्रभाव पाडू शकते, पण आंशिक सुधारणा, संरचनात्मक नियंत्रण आणि घटक-स्तरीय समायोजन शक्य करणाऱ्या मॉडेलचा उत्पादन वातावरणात जाण्याचा मार्ग अधिक स्पष्ट असतो.

AI ऑडिओ स्पर्धेसाठी हे अपडेट का महत्त्वाचे आहे

जनरेटिव्ह संगीत क्षेत्र अधिक गर्दीचे होत आहे, आणि नियंत्रण हा मुख्य भेदक घटक म्हणून पुढे येत आहे. टेक्स्ट-टू-म्युझिक प्रणालींनी आधीच दाखवून दिले आहे की त्या लहान क्लिप्स आणि शैलीगत स्केचेस तयार करू शकतात. कठीण प्रश्न म्हणजे त्यांना वारंवार वापरता येईल अशा सर्जनशील कामासाठी उपयुक्त कसे बनवायचे. यासाठी अधिक चांगली रचना, अधिक अंदाज करता येणारे टायमिंग, आणि कल्पना व पुनरावृत्ती यांच्यातील घर्षण कमी करणारी संपादन साधने लागतात.

Lyria 3.5 नेमके त्या समस्येला लक्ष्य करत असल्याचे दिसते. तीन मिनिटांपर्यंतच्या ट्रॅक लांबीमुळे मॉडेल अतिशय लहान तुकड्यांच्या पलीकडे जाते. धून, गीत, आणि आवाजातील वास्तववाद यांचे चांगले हाताळणे त्या गुणवत्तेतील फरकावर लक्ष केंद्रित करते, जो बहुतेकदा तयार झालेले संगीत आणि प्रत्यक्ष प्रकल्पात वापरता येईल असे वाटणारे संगीत यांच्यात असतो. पण अंशतः संपादनाचा कार्यप्रवाहच या प्रकाशनाला रणनीतिकदृष्ट्या महत्त्वाचा बनवतो. हे सूचित करते की Google ला समजले आहे की केवळ नवलाई नव्हे, तर नियंत्रणक्षमता स्वीकारावर परिणाम करेल.

हे व्यापक जनरेटिव्ह AI प्रवाहाशीही सुसंगत आहे. प्रतिमा, व्हिडिओ, आणि कोड प्रणालीही आता स्थानिक संपादने, संरचित परिष्करण, आणि पुनरावृत्तीच्या human-in-the-loop कार्यप्रवाहांकडे जात आहेत. ऑडिओ वेळेच्या दृष्टीने गुंतागुंतीचा असल्याने संगीत काहीसे मागे राहिले आहे: एका विभागातील लहान बदलाचा परिणाम इतर ठिकाणी लय, फ्रेसिंग, आणि संक्रमणांवर होऊ शकतो. Lyria 3.5 ने मर्यादित लांबीच्या चौकटीतही अंशतः संपादन शक्य केले, तर तो एक अर्थपूर्ण उत्पादन टप्पा ठरेल.

अपूर्ण प्रशिक्षण-डेटाचा प्रश्न

या प्रकाशनाने जनरेटिव्ह मीडिया प्रणालीभोवतीची ओळखीची चिंता पुन्हा उचलली आहे: प्रशिक्षण डेटा पारदर्शकता. Google ने Lyria 3 लाँच केले तेव्हा कंपनीने सांगितले होते की मॉडेल अशा सामग्रीवर प्रशिक्षित केले गेले होते जी YouTube आणि Google ला त्यांच्या अटी, भागीदारी करार, आणि लागू कायद्यानुसार वापरण्याची परवानगी होती. Lyria 3.5 संदर्भातील अहवालांमध्ये, नवीन मॉडेलच्या प्रशिक्षण डेटाबाबतच्या प्रश्नांना उत्तर देताना Google ने त्वरित अधिक तपशील दिला नाही.

ही तफावत महत्त्वाची आहे कारण जनरेटिव्ह संगीत अजूनही परवाने, निर्मात्यांची संमती, आणि श्रेयवाटपाच्या वादांशी जोडलेले आहे. एखादे मॉडेल नियंत्रण आणि ऑडिओ गुणवत्तेत सुधारले तरी, त्याच्या क्षमतेला कोणत्या सामग्रीने आकार दिला हे बाहेरील निरीक्षकांना स्पष्टपणे समजू शकत नसेल तर संशय कायम राहतो. कलाकार आणि हक्कधारकांसाठी, कार्यप्रवाहातील सुधारणा या प्रणाली कशा उभारल्या गेल्या याच्या व्यापक प्रश्नाचे उत्तर देत नाहीत.

त्याच वेळी, उत्पादन प्रकाशने पुढेच जात आहेत. त्यामुळे AI मीडिया मध्ये एक दुहेरी वास्तव निर्माण होते: कंपन्या चांगली साधने लाँच करण्यासाठी स्पर्धा करत आहेत, तर कायदेशीर, नैतिक आणि व्यावसायिक मानके अजूनही निश्चित झालेली नाहीत. Lyria 3.5 चे मूल्यमापन करणारे वापरकर्ते म्हणून, त्यांना एकाच वेळी दोन गोष्टी तपासाव्या लागतात. एक म्हणजे सॉफ्टवेअरची व्यावहारिक उपयुक्तता. दुसरी म्हणजे त्याभोवतीची प्रशासन व्यवस्था.

जनरेटिव्ह संगीताची अधिक व्यावहारिक अवस्था

ही उघडी प्रश्नं असूनही, Lyria 3.5 हे दर्शवते की जनरेटिव्ह संगीत प्रात्यक्षिक टप्प्यातून कार्यप्रवाहाच्या टप्प्याकडे परिपक्व होत आहे. हे अपडेट केवळ चांगल्या आउटपुटचे आश्वासन देत नाही; तर त्या आउटपुटला कसे आकार देता येईल यावर अधिक नियंत्रणाचे आश्वासन देते. केवळ नवलाईपेक्षा हा स्वीकारासाठी अधिक मजबूत युक्तिवाद आहे.

Flow Music आता या धोरणाचा वितरण स्तर म्हणून काम करत आहे. वापरकर्त्यांना विभाग समायोजित करता येतील, टेम्पो ट्यून करता येईल, आणि कालावधी अधिक अचूकपणे हाताळता येईल अशा उत्पादनात Lyria 3.5 समाविष्ट करून, Google मॉडेलला एक स्वतंत्र प्रयोग म्हणून नाही, तर सर्जनशील प्रक्रियेचा भाग म्हणून स्थान देत आहे. हा फरक महत्त्वाचा आहे कारण AI ऑडिओमधील भविष्यातील विजेते कदाचित फक्त गाणी तयार करणारी मॉडेल्स नसतील, तर लोकांना त्यात कमी अडथळ्याने सुधारणा, दिशा, आणि पूर्णता आणू देणारी मॉडेल्स असतील.

सध्या ही रिलीझ एक टप्प्याटप्प्याने पण अर्थपूर्ण बदल दर्शवते. जनरेटिव्ह संगीत साधने आता फक्त बटण दाबून परिणाम स्वीकारण्याबाबत नसून, तो मसुदा उद्देशाशी जुळेपर्यंत त्याला दिशा देण्याबाबत अधिक आहेत. हा कल टिकून राहिला, तर AI संगीत प्रणालींचे मूल्यमापन ट्रॅक बनवू शकतात की नाही यावर कमी, आणि वापरकर्ता त्यांना किती चांगल्या प्रकारे आकार देऊ शकतो यावर अधिक होईल.

  • Lyria 3.5 टेम्पो आणि ट्रॅक लांबीवर अधिक घट्ट नियंत्रण देते.
  • तयार केलेले ट्रॅक 30 सेकंदांपासून तीन मिनिटांपर्यंत असू शकतात.
  • Selective Section Painting मुळे गाण्याच्या विशिष्ट भागांमध्येच संपादन करता येते.
  • अहवालात Lyria 3.5 च्या प्रशिक्षण डेटाबाबत Google ने नवीन तपशील दिले नाहीत.

हा लेख The Decoder च्या रिपोर्टिंगवर आधारित आहे. मूळ लेख वाचा.

Originally published on the-decoder.com