Claude Opus 5, ARC-AGI-3-এ বড় ফারাক তৈরি করেছে
The Decoder-এর প্রতিবেদনে উদ্ধৃত বেঞ্চমার্ক আয়োজকদের মতে, Anthropic-এর Claude Opus 5 ARC-AGI-3-এ 30.2 শতাংশের রিপোর্টেড স্কোর নিয়ে শীর্ষস্থান দখল করেছে। এটি আগের শীর্ষ ফল 7.8 শতাংশের তুলনায় উল্লেখযোগ্য লাফ, যা একই প্রতিবেদনে OpenAI-এর GPT-5.6 Sol (Max)-এর সঙ্গে যুক্ত করা হয়েছে। এমন একটি ক্ষেত্রে, যেখানে বেঞ্চমার্কের অগ্রগতি অনেক সময় ধাপে ধাপে বা বিতর্কিত হয়, এই ব্যবধানের আকার বিশেষভাবে চোখে পড়ে।
এই ফল গুরুত্বপূর্ণ, কারণ ARC-AGI-3-কে কেবল সংরক্ষিত তথ্যের পরীক্ষা হিসেবে নয়, বরং এমন একটি পরীক্ষা হিসেবে উপস্থাপন করা হয়েছে যেখানে একটি মডেল আগে না দেখা নতুন সমস্যার মধ্য দিয়ে কীভাবে কাজ করে তা দেখা হয়। ARC Prize যে সেটআপ বর্ণনা করেছে, তাতে মডেলকে ইন্টারঅ্যাকটিভ পরিবেশে রাখা হয় এবং তাকে নিয়ম অনুমান করতে, কাজের পরিকল্পনা করতে, এবং ধাপে ধাপে সেগুলো কার্যকর করতে হয়। ফলে, এই বেঞ্চমার্ক নতুনত্বের মধ্যে যুক্তি করার সক্ষমতার একটি সংকেত হিসেবে কার্যকর, যদিও এটি অনেক পরিমাপের মধ্যে মাত্র একটি।
শুধু বেঞ্চমার্কের পারফরম্যান্স কখনওই সাধারণ বুদ্ধিমত্তার প্রশ্ন মিটিয়ে দেয় না, আর স্কোরেও নকশা, মূল্যায়ন, এবং প্রম্পটিংয়ের বিশেষত্ব প্রতিফলিত হতে পারে। কিন্তু সর্বশেষ ফলটি গুরুত্বপূর্ণ, কারণ বেঞ্চমার্ক দল নিজেই শুধু লিডারবোর্ডের সংখ্যাকে নয়, বরং মডেলটি কীভাবে যুক্তি করে তার পার্থক্যকেও ইঙ্গিত করছে।
ARC Prize কেন বলছে ফলটি আলাদা
দেওয়া উৎস-পাঠ অনুযায়ী, ARC Prize Opus 5-এর এগিয়ে থাকার কারণ হিসেবে আরও শক্তিশালী যৌক্তিক যুক্তিবোধকে চিহ্নিত করেছে, যা অপরিচিত পরিবেশে আরও স্বয়ংক্রিয় অন্বেষণ, পরিকল্পনা, এবং বাস্তবায়নকে সমর্থন করে। এটি একটি গুরুত্বপূর্ণ পার্থক্য। সাম্প্রতিক অনেক AI উন্নতি এসেছে স্কেল, টুল ব্যবহার, রিট্রিভাল, অথবা কোনও মডেলের চারপাশে সতর্কভাবে প্রকৌশল করা সিস্টেম থেকে। ARC Prize বলছে, এখানে আনুষ্ঠানিক স্কোরে শুধুমাত্র ভাষা মডেলের নিজস্ব পারফরম্যান্স ধরা হয়, অতিরিক্ত সফ্টওয়্যার হরনেস বাদ দিয়ে, যা অন্যত্র ফল বাড়াতে পারে।
এই সতর্কতাই ব্যাখ্যা করে কেন এই বেঞ্চমার্ক এখনও এত মনোযোগ পায়। মূল প্রশ্নটি হল না যে স্ক্যাফোল্ডিং দিয়ে একটি মডেলকে কঠিন কাজ সমাধান করানো যায় কি না, বরং নতুন একটি পরিস্থিতিতে ফেলে দিলে সেটি কতটা নিজে নিজে কাজ করতে পারে। যদি স্কোরের এই লাফ স্বনির্দেশিত সমস্যা সমাধানে বাস্তব উন্নতি প্রতিফলিত করে, তবে তা কেবল বাহ্যিক উন্নতি নয়, সক্ষমতায় অর্থপূর্ণ পরিবর্তনের ইঙ্গিত দেবে।
রিপোর্টে আরও বলা হয়েছে, Opus 5 আগে অমীমাংসিত পাঁচটি পরিবেশ সমাধান করেছে, যার মধ্যে চারটি মানব-স্তরের বা তারও ওপরে। মানুষেরা দ্রুত বুঝতে পারে এমন কাজকে কেন্দ্র করে তৈরি একটি বেঞ্চমার্কে এই ধরনের অগ্রগতি উল্লেখযোগ্য। এটি কেবল গড় পারফরম্যান্সের উন্নতি নয়, বরং আগের সিস্টেমগুলোর জন্য কঠিন সীমা হিসেবে কাজ করা সমস্যাগুলিও পার হওয়ার সক্ষমতা দেখায়।
পরীক্ষার সময় অস্বাভাবিক আচরণ
উৎস উপাদানের সবচেয়ে চমকপ্রদ দিকগুলোর একটি হলো শীর্ষ স্কোর নয়, বরং কাজ সমাধান করার সময় Opus 5 কীভাবে আচরণ করেছিল তার বর্ণনা। ARC Prize-এর গবেষকরা reportedly দেখেছেন, মডেলটি কাজকে বীজগাণিতিক নোটেশনে রূপান্তর করছিল এবং স্বাধীনভাবে reflection equations গঠন করছিল, যা তারা এই বেঞ্চমার্কে আগে কোনও মডেলের মধ্যে দেখেননি।
এর অর্থ এই নয় যে সিস্টেমটি মানবিক অর্থে গণিত বুঝেছে, বা এটি যন্ত্রচেতনা সম্পর্কে নতুন কোনও তত্ত্ব প্রমাণ করে। তবে এটি কোনও পাজলের পৃষ্ঠতলীয় রূপের ওপর সাধারণ pattern matching-এর তুলনায় আরও নমনীয় অভ্যন্তরীণ কৌশলের ইঙ্গিত দেয়। ব্যবহারিক দিক থেকে এর মানে, সরাসরি পদ্ধতি ব্যর্থ হলে একটি মডেল নিজের জন্য মধ্যবর্তী উপস্থাপনা তৈরি করতে পারে।
এই ক্ষমতা বেঞ্চমার্ক সংস্কৃতির বাইরেও গুরুত্বপূর্ণ। বাস্তব দুনিয়ার পরিবেশে, কার্যকর AI সিস্টেমকে প্রায়ই অস্পষ্ট সমস্যাকে নতুনভাবে সাজাতে, ছোট ছোট ধাপে ভাগ করতে, এবং উত্তর পাওয়ার আগে একাধিক সম্ভাব্য কৌশল পরীক্ষা করতে হয়। যে মডেল স্বতঃস্ফূর্তভাবে বিমূর্ত কাঠামো তৈরি করতে পারে, তা সফ্টওয়্যার কাজ, বৈজ্ঞানিক সহায়তা, রোবোটিক্স পরিকল্পনা, এবং অপারেশনাল সিদ্ধান্ত-সহায়তার জন্য সেই মডেলের চেয়ে বেশি উপযোগী হতে পারে, যে মূলত মুখস্থ সম্পর্কের ওপর নির্ভর করে।

তবু সতর্কতা প্রয়োজন। অল্পসংখ্যক চোখধাঁধানো উদাহরণ মডেলের আচরণকে বাস্তবের চেয়ে বেশি সঙ্গতিপূর্ণ বা সাধারণ বলে মনে করাতে পারে। পরের প্রশ্ন হল, একই প্রবণতা কি বৃহত্তর মূল্যায়ন এবং কম নিয়ন্ত্রিত ডিপ্লয়মেন্ট প্রেক্ষাপটেও ধারাবাহিকভাবে দেখা যায় কি না।
বিস্তৃত লিডারবোর্ড চিত্র
দেওয়া পাঠ্যে বলা হয়েছে, Opus 5 কেবল ARC-AGI-3-এ GPT-5.6 Sol (Max)-এর উপরে নয়, Anthropic-এর নিজস্ব Fable-class সিস্টেমগুলোকেও ছাড়িয়ে গেছে, যাদের ARC Prize প্রায় 20 শতাংশ স্কোর দেয়। এই অভ্যন্তরীণ তুলনাটি বাইরের তুলনার মতোই গুরুত্বপূর্ণ হতে পারে। এটি ইঙ্গিত করে যে এই অগ্রগতি ল্যাবগুলোর মধ্যে এককালীন র্যাঙ্ক পরিবর্তন নয়, বরং Anthropic-এর নিজস্ব মডেল লাইনে পারফরম্যান্সের একটি বৃহত্তর উত্থানের অংশ।
বেঞ্চমার্কের পুরোনো সংস্করণে, উৎস পাঠ বলছে Opus 5 ARC-AGI-2-এ 90.4 শতাংশ এবং ARC-AGI-1-এ 97.5 শতাংশে পৌঁছায়, আগের শীর্ষ স্কোরের সমান হলেও কিছুটা বেশি খরচে। এই তথ্যটি বর্ণনাকে জটিল করে তোলে। নতুন বেঞ্চমার্কটি সম্ভবত মডেলগুলোর মধ্যে আরও স্পষ্ট পার্থক্য তৈরি করছে, আর পুরোনো সংস্করণগুলো শীর্ষ স্তরে আগেই প্রায় স্যাচুরেশনের কাছাকাছি পৌঁছে থাকতে পারে। অন্য কথায়, ARC-AGI-3 হয়তো বেশি কার্যকর, কারণ এটি এখনও অত্যন্ত সক্ষম সিস্টেমগুলোর মধ্যে পার্থক্য করার জায়গা রাখে।
রিপোর্টে আরও বলা হয়েছে, 25টি পাবলিক ডেমো পরিবেশের মধ্যে ছয়টি এখন সমাধান হয়েছে, এবং পূর্ণ ফলাফল, রিপ্লে, ও বেঞ্চমার্কিং কোড জনসাধারণের জন্য উন্মুক্ত। ওই স্বচ্ছতা গুরুত্বপূর্ণ। বেঞ্চমার্ক দাবি তখনই বেশি মূল্যবান হয়, যখন বাইরের গবেষকেরা শুধু শেষ লিডারবোর্ডই নয়, উদাহরণ, রিপ্লে ট্রেস, এবং মূল্যায়ন পদ্ধতিও দেখতে পারেন।
এই ফল কী বোঝায় আর কী বোঝায় না
AI শিল্পের জন্য সবচেয়ে তাৎক্ষণিক শিক্ষা হলো, যুক্তিবোধ-বেঞ্চমার্ক এখনও একটি জীবন্ত প্রতিযোগিতার ক্ষেত্র। গত দুই বছরে মডেল নির্মাতারা চ্যাটের সাবলীলতা ছাড়িয়ে এমন সিস্টেমের দিকে কাজ করেছেন, যা অপরিচিত পরিবেশে চিন্তা করতে, খাপ খাইয়ে নিতে, এবং কাজ করতে পারে। নতুনত্বকে কেন্দ্র করে স্পষ্টভাবে তৈরি একটি বেঞ্চমার্কে এই পরিমাণের উল্লম্ফন অবশ্যই গবেষণা অগ্রাধিকার, বিপণন দাবি, এবং বিনিয়োগকারী বয়ানকে প্রভাবিত করবে।
কিন্তু একটি বেঞ্চমার্কই ক্ষেত্রের অবস্থা নির্ধারণ করে না। ARC-AGI-3 একটি অর্থবহ সংকেত, চূড়ান্ত রায় নয়। এটি নির্ভরযোগ্যতা, নিরাপত্তা, সত্যনিষ্ঠা, বা অর্থনৈতিকভাবে গুরুত্বপূর্ণ কাজের সম্পূর্ণ বিস্তারে পারফরম্যান্স সরাসরি মাপে না। আর বাস্তব উৎপাদন সীমাবদ্ধতার মধ্যে একটি মডেল এই আচরণগুলো কত দক্ষতার সঙ্গে ধরে রাখতে পারে, তাও দেখায় না।
যদি বেঞ্চমার্ক দলের বিশ্লেষণ টিকে যায়, তবে এই ফল দেখায় যে অপরিচিত সমস্যার মধ্য দিয়ে যুক্তি করতে পারে এমন মডেল তৈরির দৌড় নতুন এক পর্যায়ে প্রবেশ করছে। কয়েক মাস ধরে জনপরিসরের আলোচনা অতিরঞ্জন আর অবমূল্যায়নের মধ্যে দুলেছে: হয় AI সাধারণ সক্ষমতার দোরগোড়ায়, নয়তো বেঞ্চমার্কের লাভ আসলে ধোঁয়া। এই ধরনের ফলাফল দুই অবস্থাকেই জটিল করে তোলে। এগুলো সাধারণ বুদ্ধিমত্তা এসে গেছে প্রমাণ করে না, তবে অন্তত বোঝায় যে কিছু সিস্টেমকে এখন আর কেবল অটোকমপ্লিট বলে উড়িয়ে দেওয়া কঠিন হয়ে উঠছে।
পরের প্রশ্ন হলো এই সক্ষমতাগুলো স্থানান্তরিত হয় কি না। যদি হয়, তবে এই স্কোরটি লিডারবোর্ডের আপডেটের চেয়ে বেশি মনে থাকবে এই প্রাথমিক ইঙ্গিত হিসেবে যে যুক্তিবোধের উন্নতি জমা হতে শুরু করেছে। যদি না হয়, তবে এটি সেই দীর্ঘ তালিকার আরেকটি বেঞ্চমার্ক হয়ে থাকবে, যা উত্তাপ তৈরি করেছে কিন্তু AI ডিপ্লয়মেন্টের মৌলিক অর্থনীতি বদলায়নি। আপাতত, এই ফল গুরুত্বপূর্ণ কারণ এটি নির্দিষ্ট, পরিমাপযোগ্য, এবং যথেষ্ট বড় যে ক্ষেত্রের বাকিদের এর জবাব দিতেই হবে।
This article is based on reporting by The Decoder. Read the original article.
Originally published on the-decoder.com


