একটি নতুন বেঞ্চমার্ক AI-কে আরও কঠিন প্রশ্ন করে: এজেন্টরা কি সাহায্য করতে পারে, তা নয়, বরং তারা কখন মূল্যবান?
AI সিস্টেম যত উন্নত হচ্ছে, সবচেয়ে গুরুত্বপূর্ণ বাস্তব প্রশ্নটি ক্রমে এই নয় যে তারা কোনো কাজ করতে পারে কি না, বরং তারা মানুষদের তুলনায় কম মোট খরচে তা করতে পারে কি না। উন্নত AI সিস্টেম মূল্যায়নে মনোযোগী গবেষণা সংস্থা METR এই প্রশ্নের সরাসরি উত্তর খুঁজতে একটি নতুন মাপকাঠি প্রস্তাব করেছে। এর নাম “expenditure horizon”, এবং এর ধারণা সহজ: একই মাত্রার উন্নতি অর্জনে AI সিস্টেম এবং একজন মানুষকে কত খরচ করতে হয় তা তুলনা করা, তারপর সেই বিন্দু খুঁজে বের করা যেখানে তাদের খরচ সমান হয়।
অনেক সাধারণ AI বেঞ্চমার্ক পারফরম্যান্সকে সাফল্য বা ব্যর্থতার সরল ফলাফলে নামিয়ে আনে বলে এই ধারণা গুরুত্বপূর্ণ। সেই পরীক্ষাগুলো দেখাতে পারে একটি model কোনো সমস্যা সমাধান করেছে কি না, কিন্তু সেখানে পৌঁছাতে অর্থনৈতিক কী কী আপস হয়েছে তা খুব কমই বলে। কোম্পানি, গবেষণাগার এবং নীতিনির্ধারকদের জন্য AI automation কোথায় সত্যিই কার্যকর, তা নির্ধারণ করতে গেলে এই ঘাটতি উপেক্ষা করা কঠিন হয়ে উঠছে।
Expenditure horizon কীভাবে কাজ করে
উৎস অনুযায়ী, METR-এর কাঠামো মানব শ্রমের খরচ, AI সিস্টেম চালানোর খরচ, এবং পরীক্ষায় ব্যবহৃত compute-কে একক তুলনায় আনে। ফলে binary স্কোরের বদলে মূল্যের আরও ধারাবাহিক মাপ পাওয়া যায়। একই উন্নতির জন্য AI-এর বাজেট যদি মানুষের বাজেটের চেয়ে কম হয়, AI অনুকূল দিকে থাকে। AI যদি বেশি খরচ চায়, তবে মানুষই এখনও সস্তা বিকল্প।
এই কাঠামো কার্যকর, কারণ এটি অনেক প্রতিষ্ঠান বাস্তবে যেভাবে সিদ্ধান্ত নেয় তার সঙ্গে মেলে। তারা খুব কমই শুধু জিজ্ঞেস করে AI কিছু আউটপুট দিতে পারে কি না। তারা জানতে চায় oversight, experimentation, retries, এবং infrastructure যোগ করলে এটি খরচ, সময়, বা দুটোই কমায় কি না। একটি agent ডেমোতে দারুণ দেখালেও, যদি সেটি খুব বেশি compute খরচ করে বা অনেক সহায়ক রান দরকার হয়, তবে তা এই পরীক্ষায় ব্যর্থ হতে পারে।
METR বলছে, এই পদ্ধতির দুটি প্রধান সুবিধা আছে পরিচিত মূল্যায়নের তুলনায়। প্রথমত, এটি pass-fail label-এর বদলে সূক্ষ্ম অর্থনৈতিক মূল্য দেয়। দ্বিতীয়ত, এটি বহু আলাদা ইনপুটকে এক মুদ্রায় রূপান্তর করে, ফলে মানব ও যন্ত্রের শ্রমকে একই কাঠামোতে তুলনা করা সহজ হয়।
NanoGPT speedrun-এ ধারণা পরীক্ষা
এই মাপকাঠি পরীক্ষার জন্য METR NanoGPT speedrun ব্যবহার করেছে, যা একটি উন্মুক্ত কমিউনিটি প্রকল্প। এতে অংশগ্রহণকারীরা standard hardware-এ একটি language model যত দ্রুত সম্ভব train করার জন্য প্রতিযোগিতা করে, কাজটি না বদলে training approach উন্নত করে। লক্ষ্য স্থির থাকায় এবং পারফরম্যান্সের উন্নতি সময়ের সঙ্গে ট্র্যাক করা যায় বলে এটি তুলনার জন্য বিশেষভাবে পরিষ্কার একটি পরিবেশ।

উৎস বলছে, speedrun-এ May 2024 থেকে 82টি documented improvement step রেকর্ড হয়েছে, যার ফলে cumulative training time প্রায় 45 মিনিট থেকে দুই মিনিটেরও কমে নেমে আসে। এই ঐতিহাসিক রেকর্ড METR-কে অনুমান করতে সাহায্য করেছে প্রতিটি ছোট উন্নতির পেছনে কত মানব শ্রম লেগেছে, এবং তারপর সেটিকে AI system-এর মাধ্যমে একই অগ্রগতি আনার খরচের সঙ্গে তুলনা করতে।
মানব শ্রমের হিসাব করতে METR প্রকল্পের দুইজন সবচেয়ে সক্রিয় contributor-কে সাক্ষাৎকার নিয়েছে এবং Opus-4.6 নামের একটি AI model-ও ব্যবহার করেছে প্রতিটি উন্নতির পেছনের কাজ অনুমান করতে। দুই পদ্ধতিতেই প্রায় একই রকম আনুমানিক সংখ্যা পাওয়া যায়: প্রতিটি 1 শতাংশ speedup-এর জন্য প্রায় 16 ঘণ্টা কাজ। উৎস আরও বলছে, মানব পক্ষের খরচ ছিল প্রতি 1 শতাংশ speedup-এ প্রায় $2,500।
AI agents-এর জন্য প্রাথমিক ফলাফল কেন হতাশাজনক
উৎসে বর্ণিত প্রাথমিক ফলাফল উদযাপনের মতো নয়। এই বেঞ্চমার্কে expenditure horizon আজকের agents-এর জন্য খুবই আশাব্যঞ্জক নয়। এর অর্থ এই নয় যে AI system optimization-heavy কাজে অকেজো। তবে এটি ইঙ্গিত করে যে সম্পূর্ণ খরচ ধরা হলে, তারা আরও কঠিন বা উচ্চ-বাজেটের উন্নয়ন কাজে মানব contributor-দের ছাড়িয়ে যেতে এখনও হিমশিম খেতে পারে।
এই ধারা AI মূল্যায়নের বৃহত্তর ধারণার সঙ্গে মেলে: ছোট, সস্তা, সুস্পষ্টভাবে নির্ধারিত সমস্যায় agents সাধারণত শক্তিশালী দেখায়, কিন্তু কাজ জটিল এবং ব্যয়বহুল হলে তাদের সুবিধা কমে যায়। উৎসে বলা হয়েছে METR আগের পরীক্ষাগুলোতেও এমন কিছু দেখেছে। AI সহজ, কম খরচের কাজে মানুষকে হারাতে পারে, কিন্তু বাজেট বাড়লে এবং সমস্যা কঠিন হলে মানুষই বেশি অর্থনৈতিক বিকল্প হয়ে ওঠে।
এটি autonomous AI engineering নিয়ে প্রচলিত অতিরঞ্জিত বক্তব্যের একটি গুরুত্বপূর্ণ সংশোধন। কোনো agent দ্রুত একটি উপযোগী পরিবর্তন আনতে পারলে, সেটি সীমিত অপারেশনাল পরিসরে খরচ-সাশ্রয়ী হতে পারে। কিন্তু যদি সেটির জন্য ব্যাপক experimentation, বারবার prompting, বড় inference bill, বা ব্যয়বহুল support compute লাগে, তাহলে ব্যবসায়িক যুক্তি দ্রুত দুর্বল হয়ে পড়তে পারে। expenditure horizon ঠিক কোথা থেকে এই অবক্ষয় শুরু হয় তা নির্ধারণের চেষ্টা।

মাপকাঠি কী স্পষ্ট করে, আর কী মিস করে
METR-এর প্রস্তাবের মূল্য হলো এটি আলোচনাকে raw capability থেকে cost-adjusted capability-এর দিকে নিয়ে যায়। এটি আরও কঠোর মানদণ্ড, এবং বাস্তব ব্যবহারের জন্য সম্ভবত সঠিকও। প্রতিষ্ঠানগুলো শুধু নতুন বলে tool গ্রহণ করে না। তারা গ্রহণ করে যখন তা throughput বাড়ায়, খরচ কমায়, সক্ষমতা বাড়ায়, বা এই তিনটির সমন্বয় দেয়। যে benchmark এই ফলাফলগুলো নিয়ে কথা বলতে পারে না, তার ব্যবহারিক মূল্য সীমিত।
একই সঙ্গে, উৎসে বলা হয়েছে এই মাপকাঠির কিছু blind spot আছে। মানুষের শ্রম, পরীক্ষামূলক compute, এবং AI operation-কে এক dollar comparison-এ গুটিয়ে আনা যেকোনো কাঠামোতে কিছু অনুমান থাকবেই। মানব কাজের মান ভিন্ন হতে পারে। ঘণ্টাপ্রতি হার ভিন্ন হতে পারে। কিছু AI-generated ধারণা সহজেই বাতিল করা যায়, আবার কিছু বিশাল সাফল্য আনতে পারে। benchmark task নির্বাচনও গুরুত্বপূর্ণ। NanoGPT speedrunning জনসম্মুখে, পরিমাপযোগ্য, এবং প্রযুক্তিগতভাবে প্রাসঙ্গিক হলেও, এটি এখনও মাত্র একটি ক্ষেত্র।
উৎসে আরও একটি গুরুত্বপূর্ণ সতর্কতা আছে: নতুন model generation দ্রুত চিত্র বদলে দিতে পারে। আজকের হতাশাজনক expenditure horizon আগামী বছরের জন্য চূড়ান্ত নয়। model quality উন্নত হলে, tool use আরও নির্ভরযোগ্য হলে, বা inference costs কমলে, মানব ও AI অর্থনীতির মধ্যে crossover point উল্লেখযোগ্যভাবে সরে যেতে পারে।
একটি বেঞ্চমার্কের বাইরে কেন এটি গুরুত্বপূর্ণ
এই caveat-গুলোর পরেও, METR-এর প্রস্তাবটি যথাযথ সময়ে এসেছে। AI আলোচনা productivity, acceleration, এবং self-improving systems নিয়ে দাবিতে ভর্তি। সেই বিতর্কের বড় অংশ এখনও বিমূর্ত, কারণ ক্ষেত্রটিতে মানব ও যন্ত্রের শ্রমকে সমান ভিত্তিতে তুলনা করার সাধারণ পদ্ধতি নেই। expenditure horizon এমনই একটি পদ্ধতি গড়ার চেষ্টা।
এর সবচেয়ে বড় অবদান প্রযুক্তিগতের পাশাপাশি সাংস্কৃতিকও হতে পারে। এটি মূল্যায়নকে নাটকীয় demo থেকে বাজেট বাস্তবতায় সরিয়ে আনে। এমন এক বাজারে এটি সঠিক চাপ, যেখানে কোম্পানিকে বাড়তে থাকা AI ব্যয়কে মাপযোগ্য return দিয়ে ন্যায্যতা দিতে হয়। মাপকাঠিটি ছড়িয়ে পড়লে, এটি এমন workflow আলাদা করতে সাহায্য করতে পারে যেখানে agents সত্যিই অর্থনৈতিক, আর যেগুলো সব খরচ হিসাব করার পরেই কার্যকর বলে মনে হয়।
এখন পর্যন্ত METR-এর প্রাথমিক ফলাফল একটি সংযত সিদ্ধান্তের দিকে ইঙ্গিত করে। AI agents কিছু নির্দিষ্ট optimization কাজে ইতিমধ্যেই উপকারী হতে পারে, কিন্তু তাদের খরচ-সুবিধা ধরে নেওয়া উচিত নয়। ক্রেতা ও নির্মাতাদের জন্য সবচেয়ে গুরুত্বপূর্ণ জায়গাগুলোতে প্রশ্নটি আর শুধু model কী করতে পারে, তা নয়। প্রশ্ন হলো, সেটি একজন মানুষের চেয়ে সস্তায় কী করতে পারে।
এই নিবন্ধটি The Decoder-এর প্রতিবেদনের ভিত্তিতে লেখা। মূল নিবন্ধটি পড়ুন.
Originally published on the-decoder.com


