পরের AI সংকটবিন্দু হতে পারে মডেলের আকার নয়, ডেটা

একজন প্রাক্তন OpenAI গবেষক জোরালো যুক্তি দিচ্ছেন যে পরবর্তী বড় AI অস্ত্র প্রতিযোগিতা স্কেলিংয়ের চেয়ে প্রশিক্ষণ ডেটাকে কেন্দ্র করেই হবে। The Decoder-এর প্রতিবেদনের মতে, আন্দ্রু হো আট মাস পর OpenAI ছেড়ে উচ্চমানের, বিশেষায়িত ডেটাসেট তৈরি করার ওপর কেন্দ্রীভূত একটি কোম্পানি গড়ছেন। তাঁর ধারণা, বড় ভাষা মডেল এখনও অর্থনৈতিকভাবে গুরুত্বপূর্ণ কাজে দুর্বলভাবে সাধারণীকরণ করে।

এই দাবি আধুনিক AI-র সবচেয়ে স্থায়ী ধারণাগুলির একটির বিপরীতে দাঁড়ায়: বেশি কম্পিউট দিয়ে প্রশিক্ষিত বড় মডেলগুলি বিভিন্ন ডোমেইনে তাদের সক্ষমতা বাড়াতে থাকবে। হোর অবস্থান হলো, এটি যথেষ্ট নয়। তাঁর মতে, অনেক মূল্যবান কাজ খুব বেশি প্রসঙ্গনির্ভর, বর্তমান ডেটাসেটে খুব খারাপভাবে উপস্থাপিত, বা এতটাই কঠিনভাবে স্কোরযোগ্য যে আজকের স্কেলিং-প্লেবুক সেগুলিকে নির্ভরযোগ্যভাবে ধরতে পারে না।

এই যুক্তি গুরুত্বপূর্ণ, কারণ এটি নজরকে ফ্রন্টিয়ার মডেল ল্যাবগুলির দৃশ্যমান প্রতিযোগিতা থেকে ডেটা তৈরির কম আকর্ষণীয় কিন্তু ক্রমেই কৌশলগত ব্যবসার দিকে সরিয়ে দেয়। হো সঠিক হলে, AI-তে পরের স্থায়ী সুবিধা আসবে সেই পক্ষের কাছ থেকে, যারা শিল্প-পর্যায়ে কাজভিত্তিক উদাহরণ সংগ্রহ, গঠন, এবং যাচাই করতে পারবে।

কেন বর্তমান ডেটাসেট যথেষ্ট নাও হতে পারে

সূত্র প্রতিবেদনে বলা হয়েছে, হোর বিশ্বাস যে অধিকাংশ অর্থবহ অর্থনৈতিক দক্ষতা বর্তমান প্রশিক্ষণ কর্পাসে খুব সামান্যই প্রতিনিধিত্ব পেয়েছে। ইন্টারনেট-স্কেল টেক্সট যথেষ্ট হয়েছে সক্ষম চ্যাটবট, কোড সহকারী, এবং গবেষণা সরঞ্জাম তৈরির জন্য। কিন্তু তা বিশেষায়িত কাজ নির্ভরযোগ্যভাবে করতে মডেল শেখানোর জন্য যথেষ্ট নাও হতে পারে।

হোর সমালোচনা বিশেষভাবে তীক্ষ্ণ, কারণ এটি বাইরের কোনো সংশয়বাদী থেকে নয়, বরং ফ্রন্টিয়ার-মডেল ইকোসিস্টেমের ভেতর থেকেই আসছে। তিনি বলেন, মানুষ কোনো কাজে “গোল্ডেন পাথ” দেখতে পারলেও, বিকল্প পথগুলিও ভালো, খারাপ, নাকি অসম্পূর্ণ তা জানা কঠিন। এই অস্পষ্টতা বহু বাস্তবজগতের দক্ষতাকে সুন্দর বেঞ্চমার্ক পরিবেশে এনকোড করা কঠিন করে তোলে।

অন্যভাবে বললে, চ্যালেঞ্জটি শুধু আরও টেক্সট সংগ্রহ করা নয়। এটি এমন ডেটাসেট তৈরি করা যা প্রসঙ্গ, ফলাফল, সীমান্তবর্তী কেস, এবং গুণগত সংকেত সংরক্ষণ করে এমন ডোমেইনে যেখানে ভুল ব্যয়বহুল এবং সঠিক পারফরম্যান্স নিহিত জ্ঞানের ওপর নির্ভরশীল। এটি পাবলিক ওয়েব স্ক্র্যাপ করার চেয়ে অনেক কঠিন ডেটা সমস্যা।

বিস্তৃত AI উচ্চাকাঙ্ক্ষা থেকে সংকীর্ণ ডোমেইন বাস্তবায়নে

কেমব্রিজ গবেষক অ্যাডাম হান্টের কাজ এবং Google DeepMind গবেষকদের সমর্থনে হোর থিসিস আরও জোর পেয়েছে, প্রতিবেদনে এমনটাই বলা হয়েছে। ইঙ্গিত হলো, বর্তমান সিস্টেমগুলি সর্বজনীনভাবে আরও সক্ষম না হয়ে বরং আরও বিশেষায়িত হয়ে উঠছে। কিছু শিরোনাম-যোগ্য উন্নতি হয়তো অন্তর্নিহিত আরও অসম ছবিটিকে আড়াল করছে: মডেল কিছু নির্বাচিত ক্ষেত্রে উন্নত হচ্ছে, কিন্তু অন্য ক্ষেত্রে স্থবির বা দুর্বল হয়ে পড়ছে।

ল্যাবরেটরি, স্বাস্থ্যসেবা ওয়ার্কফ্লো, বৈজ্ঞানিক বিশ্লেষণ, বা অন্য উচ্চ-মূল্যের পরিবেশে AI ব্যবহার করতে চাওয়া ব্যবসার জন্য এই পার্থক্য গুরুত্বপূর্ণ। ডেমোতে চমকপ্রদ কিন্তু বাস্তব পরিবেশে অসামঞ্জস্যপূর্ণ একটি মডেল যথেষ্ট নয়। বিস্তৃত কিন্তু উপরিভাগী সাবলীলতার চেয়ে নির্ভরযোগ্যতা, পুনরাবৃত্তিযোগ্যতা, এবং ডোমেইন-নির্দিষ্ট দক্ষতা বেশি গুরুত্বপূর্ণ।

যদি মডেল নির্মাতারা সৃজনশীল সমস্যা সমাধান বা সাধারণীকৃত ট্রান্সফারে একধরনের সীমায় পৌঁছে যায়, তাহলে লক্ষ্যভিত্তিক ডেটা সেই জায়গায় ক্ষমতা এগিয়ে নেওয়ার উপায়, যেখানে তা বাস্তবে গণ্য হয়। এটাই মূলত হোর বাজি: স্কেলিং অপ্রয়োজনীয় নয়, তবে নির্দিষ্ট কাজ ঘিরে তৈরি ডেটার সঙ্গে জুড়লে তবেই এর ফলন থাকে।

AI বিকাশের দুটি পথ: সব কাজ জুড়ে ধীরে, বিস্তৃত উন্নতি (উপরে) বনাম চরম বিশেষায়ন, যেখানে কয়েকটি সক্ষমতা হঠাৎ বাড়ে আর মূল দক্ষতা স্থির থাকে বা সঙ্কুচিত হয় (নিচে). | Image: via Adam Hun
AI বিকাশের দুটি পথ: সব কাজ জুড়ে ধীরে, বিস্তৃত উন্নতি (উপরে) বনাম চরম বিশেষায়ন, যেখানে কয়েকটি সক্ষমতা হঠাৎ বাড়ে আর মূল দক্ষতা স্থির থাকে বা সঙ্কুচিত হয় (নিচে). | Image: via Adam Hun

প্রথম লক্ষ্য: বায়োইনফরমেটিক্স এবং রুটিন ল্যাব কাজ

হো যে কোম্পানি শুরু করছেন, তা নাকি দুইটি ক্ষেত্র দিয়ে শুরু করছে। একটি হলো বায়োইনফরমেটিক্স, যেখানে প্রতিবেদনে বলা হয়েছে OpenAI-তে হোর আগের কাজ সংশ্লিষ্ট জটিল বৈজ্ঞানিক বিশ্লেষণে বর্তমান মডেল যেমন GPT-5.6 Sol-এর সাফল্যের হার মাত্র প্রায় ৩০ শতাংশ। দ্বিতীয় ক্ষেত্রটি হলো রুটিন ল্যাব কাজ, যার মধ্যে গবেষকরা পরীক্ষার ছবি AI সিস্টেমে মূল্যায়নের জন্য জমা দেওয়ার পরিস্থিতিও রয়েছে।

এই শুরু করার ক্ষেত্রগুলি তাৎপর্যপূর্ণ। উভয় ক্ষেত্রেই ব্যবহারযোগ্য AI-এর জন্য ভাষার অনুকরণের চেয়ে বেশি কিছু দরকার। বায়োইনফরমেটিক্সে প্রায়ই বহু-ধাপের যুক্তি, ডোমেইন রীতি, বৈজ্ঞানিক প্রসঙ্গ, এবং ত্রুটি-সংবেদনশীলতা থাকে। ল্যাব ওয়ার্কফ্লো পাঠ্যবইয়ের উত্তর নয়, বরং ভিজ্যুয়াল বিচার, পদ্ধতিগত বোঝাপড়া, এবং বাস্তব ব্যাখ্যার ওপর নির্ভর করতে পারে। এগুলিই সেই পরিবেশ, যেখানে নিম্নমানের বা সাধারণ ডেটা সমষ্টিগত মেট্রিকে মডেলকে সক্ষম দেখালেও গুরুত্বপূর্ণ ব্যবহারে ব্যর্থ করে।

প্রতিবেদনে বলা হয়েছে, এরপর রসায়ন, উপাদান বিজ্ঞান, স্বাস্থ্যসেবা, এবং বিস্তৃত জ্ঞানভিত্তিক কাজ পরিকল্পনায় রয়েছে। সেই রোডম্যাপ এমন একটি বাণিজ্যিক কৌশলকে ইঙ্গিত করে, যা এমন শিল্পকে ঘিরে নির্মিত, যেখানে ভুলের খরচ আছে এবং যেখানে নিজস্ব ডেটা প্রতিরক্ষাযোগ্য অবকাঠামো হয়ে উঠতে পারে।

ফ্রন্টিয়ার-ল্যাব অর্থনীতির প্রতি চ্যালেঞ্জ

হো ফ্রন্টিয়ার AI ল্যাবগুলির বিশাল মূল্যায়ন নিয়েও সন্দিহান বলে মনে হচ্ছে। The Decoder-এর সারসংক্ষেপ অনুযায়ী, তিনি যুক্তি দেন যে OpenAI এবং Anthropic-এর মতো কোম্পানিগুলি দীর্ঘদিন ধরে অলাভজনক, কারণ তাদেরকে Qwen বা Kimi-এর মতো কম খরচের প্রতিদ্বন্দ্বীদের থেকে এগিয়ে থাকতে নতুন মডেলে ভারী খরচ চালিয়ে যেতে হয়। এই পূর্ণ ব্যাখ্যা কেউ মানুক বা না মানুক, এটি বাজারে বাড়তে থাকা টানাপোড়েনের দিকে ইঙ্গিত করে।

যদি ফ্রন্টিয়ার স্কেলিংয়ের প্রান্তিক খরচ উচ্চ থাকে, আর ওপেন বা সস্তা প্রতিদ্বন্দ্বীরা ব্যবধান কমিয়ে আনে, তাহলে মালিকানাভিত্তিক সুবিধা মডেলের আকার ছাড়া অন্য, অনুলিপি করা কঠিন কিছু থেকে আসতে হবে। কিউরেটেড ডেটাসেট, প্রাইভেট ওয়ার্কফ্লো, যাচাইকৃত ফলাফল, এবং ডোমেইন-নির্দিষ্ট প্রতিক্রিয়া-চক্র এই প্রয়োজনের সঙ্গে কাঁচা স্কেলের চেয়ে বেশি মানানসই। এগুলি তৈরি করতে ধীর, নকল করা কঠিন, এবং প্রায়ই গ্রাহক ব্যবহারের ক্ষেত্রে আরও ঘনিষ্ঠভাবে যুক্ত।

এর মানে এই নয় যে ভিত্তিমূলক মডেলগুলি গুরুত্ব হারায়। এর মানে হলো, তাদের পার্থক্য নির্ভর করতে পারে তাদের চারপাশে মোড়ানো ডেটার মানের ওপর। সেই পরিস্থিতিতে, ডেটা কোম্পানিগুলি মডেল ল্যাবগুলোর নিচে থাকে না; তারা সক্ষমতা-স্ট্যাকের এক গুরুত্বপূর্ণ অংশ হয়ে ওঠে।

$100 বিলিয়ন ডেটা বাজার কী ইঙ্গিত দেবে

আগামী বছরগুলিতে লক্ষ্যভিত্তিক ডেটা সংগ্রহে AI ল্যাবগুলি $100 বিলিয়নের বেশি ব্যয় করবে বলে হোর অনুমান একটি সাহসী পূর্বাভাস, তবে এর কৌশলগত যুক্তি বোঝা সহজ। সাধারণ ওয়েব ডেটা যদি সহজ লাভের উৎস হিসেবে শেষ হয়ে যায়, তাহলে শিল্পের নতুন কাঁচামাল দরকার। সেই কাঁচামাল হতে পারে টীকা-যুক্ত বৈজ্ঞানিক কাজ, যাচাইকৃত এন্টারপ্রাইজ ওয়ার্কফ্লো, মাল্টিমোডাল ল্যাব রেকর্ড, বা অন্য গঠনমূলক অভিজ্ঞতা, যা বর্তমান মডেলগুলি প্রশিক্ষণে যথেষ্ট পরিমাণে দেখে না।

এমন ব্যয় AI বুম থেকে কারা লাভবান হবে, সেটিও বদলে দেবে। মূল্য প্রধানত চিপ নির্মাতা, হাইপারস্কেলার, এবং ফ্রন্টিয়ার-মডেল ডেভেলপারদের মধ্যে কেন্দ্রীভূত হওয়ার বদলে, একটি ডেটা-কেন্দ্রিক চক্র ডোমেইন বিশেষজ্ঞ, লেবেলিং সিস্টেম, সিন্থেটিক-ডেটা টুলিং, এন্টারপ্রাইজ ডেটা অংশীদারত্ব, এবং বিশেষায়িত পরিবেশে গুণমান মাপতে সক্ষম প্রতিষ্ঠানগুলিকে এগিয়ে দেবে।

সারকথা হলো, AI প্রতিযোগিতা আরও কম দৃশ্যমান কিন্তু আরও মৌলিক এক পর্যায়ে প্রবেশ করছে। পরের বড় লাফ কেবল মডেল বড় করার ফলে নাও আসতে পারে। তা আসতে পারে মডেলকে আরও ভালোভাবে শেখানো থেকে, এমন ডেটা দিয়ে যা এখনও অটোমেশনকে প্রতিরোধ করা জটিল, প্রসঙ্গনির্ভর, উচ্চ-ঝুঁকির কাজের জন্য তৈরি। হো বিশ্বাস করছেন, এই পরিবর্তন কোনো পার্শ্বকথা নয়। তিনি বাজি ধরছেন, এটি আগামী AI চক্রের সংজ্ঞায়িত বাজারগুলির একটি হয়ে উঠবে।

এই নিবন্ধটি The Decoder-এর প্রতিবেদনের ওপর ভিত্তি করে। মূল নিবন্ধটি পড়ুন.

Originally published on the-decoder.com