গান তৈরি থেকে ধাপে ধাপে সম্পাদনার দিকে Google-এর অগ্রসরতা
Google তার সঙ্গীত-জেনারেশন মডেলের সর্বশেষ সংস্করণ Lyria 3.5 প্রকাশ করেছে এবং সেটিকে Flow Music-এর নতুন সম্পাদনা নিয়ন্ত্রণের সঙ্গে যুক্ত করেছে। এই আপডেটটি কেবল কাঁচা জেনারেশনের চেয়েও বেশি কিছু বোঝায়; এটি ইঙ্গিত দেয় যে জেনারেটিভ অডিও টুলগুলো একবারে তৈরি করার পদ্ধতি থেকে সরে এসে সফটওয়্যার-সদৃশ পুনর্বিবেচনা ও সংশোধনের কর্মপ্রবাহের দিকে এগোচ্ছে।
Google-এর দাবি, Lyria 3.5 আরও স্বাভাবিক শোনায় এমন সুর, উন্নত লিরিক্স এবং আরও বাস্তবসম্মত ভোকাল দেয়, যেখানে উচ্চারণও বেশি স্পষ্ট। কোম্পানিটি আরও বলছে, ব্যবহারকারীরা এখন টেম্পো এবং ট্র্যাকের দৈর্ঘ্যের ওপর আরও সূক্ষ্ম নিয়ন্ত্রণ পাবেন, আর তৈরি হওয়া অংশের দৈর্ঘ্য হবে 30 সেকেন্ড থেকে তিন মিনিট পর্যন্ত। এসব উন্নতি গুরুত্বপূর্ণ, তবে আরও তাৎপর্যপূর্ণ সংযোজন হতে পারে Selective Section Painting নামের একটি ফিচার, যা ব্যবহারকারীদের পুরো ট্র্যাক আবার শুরু থেকে বানাতে না গিয়ে কেবল নির্দিষ্ট অংশ সংশোধন করার সুযোগ দেয়।
এই পরিবর্তনটি জেনারেটিভ মিডিয়া সিস্টেমগুলোর এক স্থায়ী দুর্বলতার সমাধান করে। এগুলো অনেক সময় প্রথম খসড়া হিসেবে গ্রহণযোগ্য কিছু তৈরি করতে পারে, কিন্তু ব্যবহারকারী যখন খুব নির্দিষ্ট একটি সংশোধন চান, তখন সেগুলো কম কার্যকর হয়। যদি কোরাস ঠিকঠাক হয় কিন্তু ভার্স না হয়, বা বিট ঠিক বসে কিন্তু ভোকাল ফ্রেজিং লক্ষ্যভ্রষ্ট হয়, তাহলে পুরো কম্পোজিশন আবার শুরু করা অকার্যকর। ব্যবহারকারীকে স্থানীয়ভাবে হস্তক্ষেপ করার সুযোগ দেওয়া একটি সিস্টেম তখন আর শুধু কৌতূহল জাগানো জেনারেটর মনে হয় না, বরং সৃজনশীল প্রোডাকশন টুলের মতো দেখাতে শুরু করে।
প্রম্পট আউটপুট থেকে সম্পাদনাযোগ্য কম্পোজিশন
Selective Section Painting দেখায় যে AI মিউজিক ইন্টারফেসে একটি নতুন ধাপ আসছে। গানকে একটি অবিভাজ্য একক আউটপুট হিসেবে দেখার বদলে, মডেল সেটিকে এমন কিছু হিসেবে বিবেচনা করে যা অংশভিত্তিক সম্পাদনা করা যায়। এটি সংগীতশিল্পী, প্রযোজক এবং সাউন্ড ডিজাইনাররা বাস্তবে যেভাবে কাজ করেন, তার সঙ্গে মেলে। তারা খুব কমই পুরো খসড়া বাতিল করেন শুধু একটি অংশ বদলাতে হবে বলে। তারা টাইমিং ঠিক করেন, অংশ পুনর্লিখন করেন, যন্ত্রানুষঙ্গের বিন্যাস বদলান, এবং কেবল সেই অংশই আবার গড়ে তোলেন যা কাজ করছে না।
Google বলছে, এই সিস্টেম ছোট সুরকে আরও পূর্ণাঙ্গ গানে রূপ দিতে পারে, তাও পুরো প্রক্রিয়া আবার শুরু করতে বাধ্য না করে। বাস্তবে এর মানে, ব্যবহারকারী একটি ধারণা আঁকতে পারেন, তারপর যা ইতিমধ্যে কাজ করছে তা রেখে সেটিকে ধাপে ধাপে বড় করতে পারেন। ভোকাল, ড্রাম, বেস এবং অন্যান্য উপাদানের ওপর টেম্পো ও সময়কাল আরও নিখুঁতভাবে নিয়ন্ত্রণের সঙ্গে এটি স্রষ্টা ও মডেলের মধ্যে আরও মডুলার সম্পর্কের দিকে ইঙ্গিত করে।
এই মডুলারিটি বাণিজ্যিকভাবে গুরুত্বপূর্ণ। জেনারেটিভ টুল তখনই বাস্তব সৃজনশীল কর্মপ্রবাহে বেশি ভালোভাবে ঢোকে, যখন সেগুলো পুনরাবৃত্তি-ভিত্তিক কাজ সমর্থন করতে পারে। শুধু সম্পূর্ণ প্রস্তুত আর্টিফ্যাক্ট আউটপুট করা একটি মডেল ডেমোতে চমক দিতে পারে, কিন্তু আংশিক সংশোধন, কাঠামোগত নিয়ন্ত্রণ এবং উপাদান-স্তরের সমন্বয় করতে দেওয়া একটি মডেলের উৎপাদন পরিবেশে প্রবেশের পথ বেশি স্পষ্ট।
AI অডিও প্রতিযোগিতায় এই আপডেটের গুরুত্ব
জেনারেটিভ মিউজিক খাত ক্রমেই ভিড়াক্রান্ত হয়ে উঠছে, আর নিয়ন্ত্রণ এখন প্রধান পার্থক্যসূচক উপাদান হিসেবে উঠে আসছে। টেক্সট-টু-মিউজিক সিস্টেম ইতিমধ্যেই দেখিয়েছে যে তারা ছোট ক্লিপ এবং স্টাইলিস্টিক স্কেচ তৈরি করতে পারে। কঠিন সমস্যা হলো সেগুলোকে পুনরাবৃত্ত সৃজনশীল কাজের জন্য ব্যবহারযোগ্য করে তোলা। এর অর্থ আরও ভালো কাঠামো, আরও পূর্বানুমেয় টাইমিং, এবং এমন সম্পাদনা সরঞ্জাম যা ধারণা ও সংশোধনের মধ্যে ঘর্ষণ কমায়।
Lyria 3.5 স্পষ্টভাবে সেই সমস্যাকেই লক্ষ্য করছে বলে মনে হয়। সর্বোচ্চ তিন মিনিটের ট্র্যাক দৈর্ঘ্য মডেলকে খুব ছোট স্নিপেটের সীমা ছাড়িয়ে নিয়ে যায়। সুর, লিরিক্স এবং ভোকাল বাস্তবতার উন্নত পরিচালনা এমন মানের ব্যবধানকে লক্ষ্য করে, যা প্রায়ই জেনারেট করা সংগীতকে এমন উপাদান থেকে আলাদা করে, যা কেউ বাস্তব কোনো প্রকল্পে ব্যবহার হতে কল্পনা করতে পারে। কিন্তু আংশিক-সম্পাদনার এই কর্মপ্রবাহই প্রকাশনাটিকে কৌশলগতভাবে গুরুত্বপূর্ণ করে তোলে। এটি দেখায় যে Google বুঝেছে, শুধু নতুনত্ব নয়, নিয়ন্ত্রণযোগ্যতাই গ্রহণযোগ্যতা নির্ধারণ করবে।
এটি জেনারেটিভ AI-এর বৃহত্তর প্রবণতার সঙ্গেও সামঞ্জস্যপূর্ণ। ইমেজ, ভিডিও এবং কোড সিস্টেমগুলোও এখন স্থানীয় সম্পাদনা, কাঠামোবদ্ধ পরিমার্জন এবং পুনরাবৃত্ত human-in-the-loop কর্মপ্রবাহের দিকে এগোচ্ছে। অডিওর সময়গত জটিলতার কারণে সঙ্গীত কিছুটা পিছিয়ে ছিল: একটি সেগমেন্টে ছোট পরিবর্তন অন্যত্র 리দম, ফ্রেজিং এবং ট্রানজিশনকে প্রভাবিত করতে পারে। যদি Lyria 3.5 সীমিত দৈর্ঘ্যের মধ্যেও আংশিক সম্পাদনাকে কার্যকর করে তুলতে পারে, তবে সেটি একটি অর্থপূর্ণ পণ্যগত পদক্ষেপ।
অমীমাংসিত প্রশিক্ষণ-ডেটার প্রশ্ন
এই প্রকাশটি জেনারেটিভ মিডিয়া সিস্টেম ঘিরে পরিচিত এক উদ্বেগকে আবার সামনে আনে: প্রশিক্ষণ ডেটার স্বচ্ছতা। Google যখন Lyria 3 চালু করে, তখন কোম্পানি বলেছিল যে মডেলটি এমন উপাদান দিয়ে প্রশিক্ষিত, যা YouTube এবং Google তাদের শর্তাবলি, অংশীদারিত্ব চুক্তি এবং প্রযোজ্য আইন অনুযায়ী ব্যবহার করতে অনুমোদিত ছিল। Lyria 3.5 নিয়ে প্রতিবেদনে, নতুন মডেলের প্রশিক্ষণ ডেটা সম্পর্কে প্রশ্নের জবাবে Google তাৎক্ষণিকভাবে অতিরিক্ত বিবরণ দেয়নি।
এই ফাঁকটি গুরুত্বপূর্ণ, কারণ জেনারেটিভ সংগীত এখনো লাইসেন্সিং, স্রষ্টার সম্মতি এবং স্বীকৃতি-সংক্রান্ত বিতর্কের সঙ্গে জড়িত। একটি মডেল নিয়ন্ত্রণ ও অডিও মানের দিক থেকে উন্নত হতে পারে, তবু বাইরের পর্যবেক্ষকেরা যদি পরিষ্কারভাবে বুঝতে না পারেন কোন উপাদান তার সক্ষমতা গড়েছে, তাহলে সংশয় থেকে যায়। শিল্পী ও অধিকারধারীদের জন্য, কর্মপ্রবাহের উন্নতি এই সিস্টেমগুলো কীভাবে তৈরি হয়েছে সেই বড় প্রশ্নের উত্তর দেয় না।
একই সময়ে, পণ্য প্রকাশ অব্যাহতই রয়েছে। এর ফলে AI মিডিয়ায় একটি দ্বৈত বাস্তবতা তৈরি হচ্ছে: কোম্পানিগুলো আরও ভালো টুল বাজারে আনতে দৌড়াচ্ছে, কিন্তু আইনগত, নৈতিক এবং বাণিজ্যিক মানদণ্ড এখনও স্থির হয়নি। তাই Lyria 3.5 মূল্যায়ন করা ব্যবহারকারীরা একসঙ্গে দুটি বিষয় বিচার করছেন। একটি হলো সফটওয়্যারের ব্যবহারিক উপযোগিতা। অন্যটি হলো এর চারপাশের শাসনব্যবস্থা।
জেনারেটিভ সংগীতের আরও ব্যবহারিক ধাপ
এসব প্রশ্ন উন্মুক্ত থাকলেও, Lyria 3.5 দেখায় যে জেনারেটিভ সংগীত এখন প্রদর্শনী থেকে কর্মপ্রবাহের দিকে পরিপক্ব হচ্ছে। এই আপডেট কেবল উন্নত আউটপুটের প্রতিশ্রুতি দেয় না; এটি সেই আউটপুট কীভাবে গঠিত হবে, তার ওপর আরও নিয়ন্ত্রণের প্রতিশ্রুতি দেয়। কাঁচা নতুনত্বের চেয়ে এটি গ্রহণযোগ্যতার জন্য আরও শক্তিশালী যুক্তি।
Flow Music এখন সেই কৌশলের ডেলিভারি স্তর হিসেবে কাজ করছে। ব্যবহারকারীরা যাতে সেকশন সামঞ্জস্য করতে, টেম্পো টিউন করতে এবং সময়কাল আরও নিখুঁতভাবে পরিচালনা করতে পারেন, এমন একটি পণ্যের মধ্যে Lyria 3.5-কে এম্বেড করে Google মডেলটিকে বিচ্ছিন্ন পরীক্ষা নয়, বরং সৃজনশীল প্রক্রিয়ার অংশ হিসেবে স্থাপন করছে। এই পার্থক্য গুরুত্বপূর্ণ, কারণ AI অডিওতে ভবিষ্যতের বিজয়ীরা হয়তো শুধু গান তৈরি করতে পারে এমন মডেল হবে না, বরং এমন মডেলও হবে যা মানুষকে কম ঘর্ষণে সেগুলো সংশোধন, পরিচালনা এবং শেষ করতে দেয়।
এ মুহূর্তে, এই প্রকাশ একটি ধাপে ধাপে হলেও তাৎপর্যপূর্ণ পরিবর্তন নির্দেশ করে। জেনারেটিভ মিউজিক টুল এখন কেবল একটি বোতাম চাপার পর ফলাফল মেনে নেওয়ার বিষয় নয়, বরং উদ্দেশ্যের সঙ্গে মিল না হওয়া পর্যন্ত খসড়াকে নির্দেশনা দেওয়ার বিষয় হয়ে উঠছে। যদি এই ধারা বজায় থাকে, তাহলে AI মিউজিক সিস্টেমগুলোকে ক্রমেই বিচার করা হবে না কেবল তারা ট্র্যাক বানাতে পারে কি না, বরং ব্যবহারকারী কত ভালোভাবে একটি ট্র্যাককে গড়ে নিতে পারেন তার ওপর।
- Lyria 3.5 টেম্পো এবং ট্র্যাকের দৈর্ঘ্যের ওপর আরও কড়া নিয়ন্ত্রণ যোগ করে।
- তৈরি হওয়া ট্র্যাক 30 সেকেন্ড থেকে তিন মিনিট পর্যন্ত হতে পারে।
- Selective Section Painting নির্দিষ্ট গান-অংশে সম্পাদনার সুযোগ দেয়।
- প্রতিবেদনে Lyria 3.5-এর প্রশিক্ষণ ডেটা নিয়ে Google নতুন কোনো তথ্য দেয়নি।
এই নিবন্ধটি The Decoder-এর প্রতিবেদনের ওপর ভিত্তি করে। মূল নিবন্ধ পড়ুন.
Originally published on the-decoder.com


