OpenAI বলছে তারা ARC-AGI-3-এ এগিয়ে গেছে, কিন্তু এই বেঞ্চমার্ক-বিতর্ক আসলে টুলিং নিয়ে

OpenAI বলছে, তাদের GPT-5.6 Sol মডেল ARC-AGI-3-এ 38.3% স্কোর করেছে, যা একই বেঞ্চমার্কে Anthropic-এর Claude Opus 5-এর 30.2%-এর চেয়ে বেশি। কাগজে-কলমে এটি বিমূর্ত যুক্তির ওপর ঘনিষ্ঠভাবে নজর রাখা প্রতিযোগিতায় একেবারে সরাসরি উল্টে যাওয়া বলে মনে হতে পারে। বাস্তবে, বিষয়টি আরও জটিল। এই বেশি ফলাফলটি GPT-5.6 Sol-কে OpenAI-এর নিজস্ব Responses API এবং বেঞ্চমার্কের মানক টেস্ট হার্নেসের অংশ নয় এমন দুটি নির্দিষ্ট সেটিংস দিয়ে চালানোর ওপর নির্ভর করে।

এই পার্থক্যটি গুরুত্বপূর্ণ, কারণ ARC-AGI-3 এমনভাবে তৈরি করা হয়েছে যাতে দেখা যায় কোনো মডেল অপরিচিত যুক্তির সমস্যা কতটা ভালোভাবে সামলায়, কোনো বিক্রেতা তার মডেলকে পণ্য-নির্দিষ্ট অবকাঠামোর মধ্যে কতটা দক্ষতার সঙ্গে মুড়ে ফেলে তা নয়। প্রদত্ত উৎসপাঠ অনুযায়ী, GPT-5.6 Sol অফিসিয়াল হার্নেসে মাত্র 7.8% পেয়েছে, যেখানে প্রতিটি action-এর পরে মডেলের reasoning বাতিল করে দেওয়া হয়। OpenAI-এর অনেক বেশি স্কোর এসেছে “Retained Reasoning” ব্যবহার করে, যা ধাপগুলোর মধ্যে মডেলের chain of thought ধরে রাখে, এবং “Compaction” ব্যবহার করে, যা পুরনো context বাদ না দিয়ে সংক্ষিপ্ত করে।

এই ফলাফলটি এমন এক বিতর্ক তৈরি করে যা একটি leaderboard আপডেটের চেয়েও গভীর। এটি AI evaluation-এ এখন কেন্দ্রীয় প্রশ্নটি সামনে আনে: systems যখন memory handling, context management, এবং API design-এর মাধ্যমে উন্নত হয়, তখন model capability আর product scaffolding-এর মধ্যে সীমা কোথায় টানা উচিত?

ARC-AGI-3 কেন এত বড় বিতর্কের কেন্দ্রে

ARC-ধরনের বেঞ্চমার্কগুলোর AI শিল্পে অস্বাভাবিক গুরুত্ব রয়েছে, কারণ তারা memorization নয়, generalization-কে পরীক্ষা করতে চায়। এই tasks এমনভাবে তৈরি যে একটি system নিয়ম অনুমান করতে এবং নতুন puzzles সমাধান করতে পারে কি না, তা দেখা যায়, তাই broader reasoning progress-এর প্রমাণ খুঁজছেন এমন গবেষক ও বিক্রেতাদের কাছে এগুলো বিশেষভাবে আকর্ষণীয়। এ কারণেই setup নিয়ে বিতর্ক এত সংবেদনশীল হয়ে ওঠে। model performance আলাদা করে মাপার জন্য তৈরি একটি বেঞ্চমার্ক তখন বোঝা কঠিন হয়ে যায়, যদি কোনো provider-এর ফল standard environment-এর বাইরের features-এর ওপর নির্ভর করে।

উৎসপাঠে বর্ণিত OpenAI-এর যুক্তি হলো, বেঞ্চমার্ক কখনো শুধু মডেল মাপে না। এটি তার চারপাশের প্রযুক্তিগত সেটআপও মাপে। এই অবস্থান বৃহত্তর শিল্পবাস্তবতাকেই প্রতিফলিত করে। deployed products-এ models খুব কমই একা কাজ করে। তারা orchestration layers, context windows, retrieval systems, tool use, এবং state management-এর ওপর নির্ভরশীল। যদি কোনো বেঞ্চমার্ক এসব component উপেক্ষা করে, তাহলে বিক্রেতারা যুক্তিসঙ্গতভাবেই বলতে পারে যে এটি বাস্তবজগতের performance-কে কম দেখাচ্ছে।

কিন্তু ARC-AGI-3 সব বাস্তব deployment সিদ্ধান্তকে প্রতিফলিত করার জন্য তৈরি হয়নি। provider-to-provider তুলনা অর্থবহ করার জন্য এটিকে যথেষ্ট standardize করা পরিবেশে ডিজাইন করা হয়েছে। তাই official benchmark harness এই আলোচনায় এত গুরুত্বপূর্ণ। OpenAI যখন ওই হার্নেসের বাইরে অনেক শক্তিশালী score প্রকাশ করে, তখন তা হয়তো আরও সক্ষম product stack দেখাচ্ছে, কিন্তু এটি অবশ্যই প্রমাণ করছে না যে benchmark-এর মূল নিয়মের অধীনে base model আরও শক্তিশালী।

যে দুটি সেটিংস ফল বদলে দিল

উৎসপাঠে এই উত্থানের পেছনে OpenAI-এর দুটি feature চিহ্নিত করা হয়েছে। প্রথমটি, Retained Reasoning, ধাপগুলোর মধ্যে মডেলের chain of thought ধরে রাখে। দ্বিতীয়টি, Compaction, পুরনো context truncate না করে সেটিকে সংক্ষিপ্ত করে। একসঙ্গে, এই সেটিংসগুলো official harness-এ GPT-5.6 Sol-কে যে দুর্বলতা পিছিয়ে দিয়েছিল তা সমাধান করছে বলে মনে হয়, যেখানে প্রতিটি action-এর পরে মধ্যবর্তী reasoning হারিয়ে যেত।

এই ধরনের persistence বহু-ধাপের reasoning tasks-এ নির্ণায়ক হতে পারে। কোনো মডেল যদি আগের সিদ্ধান্তগুলো সংরক্ষণ করতে পারে এবং সেগুলোকে ব্যবহারযোগ্য context-এ সংকুচিত করতে পারে, তবে বারবার নিজের internal state পুনর্গঠন করার প্রয়োজন এড়াতে পারে। অন্য কথায়, benchmark-এর ফল বদলায়নি কারণ puzzle বদলে গেছে, বরং system-কে সমাধানের সময় আরও কার্যকরভাবে মনে রাখতে দেওয়া হয়েছে।

GPT-5.6 Sol's ARC-AGI-3 scores jump dramatically when using OpenAI's custom harness with retained reasoning and compaction, compared to the official test harness. | Image: OpenAI
GPT-5.6 Sol's ARC-AGI-3 scores jump dramatically when using OpenAI's custom harness with retained reasoning and compaction, compared to the official test harness. | Image: OpenAI

সুতরাং OpenAI-এর দাবি সম্ভবত এই বিস্তৃত ব্যাখ্যার ওপর দাঁড়িয়ে আছে যে পরীক্ষাধীন system আসলে কী। যদি “system”-এর মধ্যে বিক্রেতার API behavior এবং memory-management features অন্তর্ভুক্ত থাকে, তবে 38.3% score প্রাসঙ্গিক। যদি “system” বলতে neutral standardized interface-এর অধীনে থাকা মডেল বোঝায়, তাহলে official 7.8% সংখ্যাটিই তুলনার জন্য বেশি সরাসরি।

ARC Prize-এর প্রতিক্রিয়া দুই দৃষ্টিভঙ্গিরই জায়গা রাখে

প্রদত্ত উৎসপাঠ বলছে, ARC Prize co-founder François Chollet দুই ধরনের test setup-এর মধ্যে পার্থক্য টেনে প্রতিক্রিয়া দিয়েছেন। বিশেষভাবে বেঞ্চমার্ক সমাধানের জন্য বানানো custom harnesses, অথবা benchmark format সম্পর্কে জ্ঞান থাকা setup-গুলো, অনুমোদিত নয়। অন্যদিকে, সব ব্যবহারকারীর জন্য উপলভ্য general-purpose API settings গ্রহণযোগ্য। Chollet আরও বলেছেন যে compaction নিয়ে OpenAI-এর model-গুলো কীভাবে সবচেয়ে ভালোভাবে পরীক্ষা করা যায়, তা নিয়ে ARC Prize-এর সঙ্গে চলমান আলোচনা ছিল, এবং কোম্পানিটি “starting to figure out the answer” অবস্থায় পৌঁছাচ্ছে বলে তিনি স্বাগত জানিয়েছেন।

এই প্রতিক্রিয়াটি উল্লেখযোগ্য, কারণ এটি OpenAI-এর score-কে সরাসরি বাতিল করছে না। বরং এটি ইঙ্গিত দেয় যে ARC Prize কিছু provider-specific setting-কে বৈধ মনে করে, যদি সেগুলো general-purpose হয়, ব্যাপকভাবে উপলভ্য হয়, এবং খরচসহ স্বচ্ছভাবে রিপোর্ট করা হয়। একই সঙ্গে, উৎসপাঠে বলা হয়েছে, ভিন্ন providers ভিন্ন settings ব্যবহার করলে parity issue তৈরি হতে পারে। অন্য কথায়, benchmark organizer কিছু asymmetry সহ্য করতে রাজি, যদিও সে স্বীকার করছে যে এতে সরাসরি তুলনা জটিল হয়ে যায়।

এতে বিতর্কটি OpenAI-এর ফল বৈধ কি না, সেখান থেকে সরে গিয়ে বৈধতার ধরন কী, সেই প্রশ্নে চলে আসে। এটি GPT-5.6 Sol-কে OpenAI-এর বর্তমান API stack-এর মাধ্যমে ব্যবহার করার ফলাফল হিসেবে বৈধ হতে পারে। কিন্তু ভিন্ন অনুমানের অধীনে পরীক্ষিত models-এর সঙ্গে পরিষ্কার apples-to-apples benchmark ফলাফল হিসেবে এটি ততটা স্পষ্ট নয়।

AI benchmarking এখন কী বলছে

এই বিতর্ক AI evaluation-এ একটি বৃহত্তর পরিবর্তন দেখায়। frontier systems যত বেশি agentic এবং দীর্ঘমেয়াদি workflows-এর ওপর নির্ভরশীল হচ্ছে, benchmark performance ততই runtime design choices-এর ওপর নির্ভর করবে, শুধু underlying model weights-এর ওপর নয়। Memory retention, context compression, step orchestration, এবং interface design সবই ফলাফল বদলে দিতে পারে। এতে static leaderboard দিয়ে vendor-দের তুলনা করতে চাওয়া যে কারও জন্য সমস্যা তৈরি হয়।

এটাও বোঝায় যে benchmark consumers-দের আরও নির্দিষ্ট প্রশ্ন করা দরকার। মডেল কি default configuration-এ test করা হয়েছিল? vendor-specific features কি enabled ছিল? হার্নেস কি intermediate reasoning ধরে রেখেছিল? খরচ এবং সেটিংস কি প্রকাশ করা হয়েছিল? এমন context ছাড়া headline score আগের মতো তথ্যবহুল থাকে না।

OpenAI-এর জন্য, এই ঘোষণা দেখায় যে কোম্পানিটি Anthropic-এর সাম্প্রতিক benchmark momentum-কে চ্যালেঞ্জ করতে দৃঢ়প্রতিজ্ঞ। ARC Prize-এর জন্য, এই প্রতিক্রিয়া modern API realities-এর সঙ্গে rules খাপ খাইয়ে নেওয়ার একটি বাস্তবসম্মত ইচ্ছা প্রকাশ করে, তবে সেই অভিযোজন benchmark-specific hacks হওয়া চলবে না। আর বৃহত্তর শিল্পের জন্য, শিক্ষা হলো নির্দিষ্ট দিনে কে প্রথম, তার চেয়ে বেশি গুরুত্বপূর্ণ হলো model performance product-layer intelligence-এর ওপর নির্ভর করলে একটি “fair” test সংজ্ঞায়িত করা কত কঠিন হয়ে পড়েছে।

এর মানে এই নয় যে বেঞ্চমার্ক অপ্রাসঙ্গিক। এর মানে disclosure আরও গুরুত্বপূর্ণ হয়ে যায়। OpenAI-এর 38.3% score অর্থবহ, কারণ এটি দেখায় GPT-5.6 Sol-এর reasoning ধরে রাখা হলে এবং context truncate না করে compact করা হলে তার পারফরম্যান্স অনেক ভালো হতে পারে। official 7.8% score অর্থবহ, কারণ এটি দেখায় একই মডেল বেঞ্চমার্কের কঠোর standard harness-এর অধীনে অনেক খারাপ করে। দুটি সংখ্যাই বাস্তব কিছু বর্ণনা করে। তারা শুধু একই জিনিস বর্ণনা করে না।

এই নিবন্ধটি The Decoder-এর প্রতিবেদনের ভিত্তিতে। মূল নিবন্ধ পড়ুন.

Originally published on the-decoder.com