Claude Opus 5, ARC-AGI-3-এ বড় ফারাক তৈরি করেছে

The Decoder-এর প্রতিবেদনে উদ্ধৃত বেঞ্চমার্ক আয়োজকদের মতে, Anthropic-এর Claude Opus 5 ARC-AGI-3-এ 30.2 শতাংশের রিপোর্টেড স্কোর নিয়ে শীর্ষস্থান দখল করেছে। এটি আগের শীর্ষ ফল 7.8 শতাংশের তুলনায় উল্লেখযোগ্য লাফ, যা একই প্রতিবেদনে OpenAI-এর GPT-5.6 Sol (Max)-এর সঙ্গে যুক্ত করা হয়েছে। এমন একটি ক্ষেত্রে, যেখানে বেঞ্চমার্কের অগ্রগতি অনেক সময় ধাপে ধাপে বা বিতর্কিত হয়, এই ব্যবধানের আকার বিশেষভাবে চোখে পড়ে।

এই ফল গুরুত্বপূর্ণ, কারণ ARC-AGI-3-কে কেবল সংরক্ষিত তথ্যের পরীক্ষা হিসেবে নয়, বরং এমন একটি পরীক্ষা হিসেবে উপস্থাপন করা হয়েছে যেখানে একটি মডেল আগে না দেখা নতুন সমস্যার মধ্য দিয়ে কীভাবে কাজ করে তা দেখা হয়। ARC Prize যে সেটআপ বর্ণনা করেছে, তাতে মডেলকে ইন্টারঅ্যাকটিভ পরিবেশে রাখা হয় এবং তাকে নিয়ম অনুমান করতে, কাজের পরিকল্পনা করতে, এবং ধাপে ধাপে সেগুলো কার্যকর করতে হয়। ফলে, এই বেঞ্চমার্ক নতুনত্বের মধ্যে যুক্তি করার সক্ষমতার একটি সংকেত হিসেবে কার্যকর, যদিও এটি অনেক পরিমাপের মধ্যে মাত্র একটি।

শুধু বেঞ্চমার্কের পারফরম্যান্স কখনওই সাধারণ বুদ্ধিমত্তার প্রশ্ন মিটিয়ে দেয় না, আর স্কোরেও নকশা, মূল্যায়ন, এবং প্রম্পটিংয়ের বিশেষত্ব প্রতিফলিত হতে পারে। কিন্তু সর্বশেষ ফলটি গুরুত্বপূর্ণ, কারণ বেঞ্চমার্ক দল নিজেই শুধু লিডারবোর্ডের সংখ্যাকে নয়, বরং মডেলটি কীভাবে যুক্তি করে তার পার্থক্যকেও ইঙ্গিত করছে।

ARC Prize কেন বলছে ফলটি আলাদা

দেওয়া উৎস-পাঠ অনুযায়ী, ARC Prize Opus 5-এর এগিয়ে থাকার কারণ হিসেবে আরও শক্তিশালী যৌক্তিক যুক্তিবোধকে চিহ্নিত করেছে, যা অপরিচিত পরিবেশে আরও স্বয়ংক্রিয় অন্বেষণ, পরিকল্পনা, এবং বাস্তবায়নকে সমর্থন করে। এটি একটি গুরুত্বপূর্ণ পার্থক্য। সাম্প্রতিক অনেক AI উন্নতি এসেছে স্কেল, টুল ব্যবহার, রিট্রিভাল, অথবা কোনও মডেলের চারপাশে সতর্কভাবে প্রকৌশল করা সিস্টেম থেকে। ARC Prize বলছে, এখানে আনুষ্ঠানিক স্কোরে শুধুমাত্র ভাষা মডেলের নিজস্ব পারফরম্যান্স ধরা হয়, অতিরিক্ত সফ্টওয়্যার হরনেস বাদ দিয়ে, যা অন্যত্র ফল বাড়াতে পারে।

এই সতর্কতাই ব্যাখ্যা করে কেন এই বেঞ্চমার্ক এখনও এত মনোযোগ পায়। মূল প্রশ্নটি হল না যে স্ক্যাফোল্ডিং দিয়ে একটি মডেলকে কঠিন কাজ সমাধান করানো যায় কি না, বরং নতুন একটি পরিস্থিতিতে ফেলে দিলে সেটি কতটা নিজে নিজে কাজ করতে পারে। যদি স্কোরের এই লাফ স্বনির্দেশিত সমস্যা সমাধানে বাস্তব উন্নতি প্রতিফলিত করে, তবে তা কেবল বাহ্যিক উন্নতি নয়, সক্ষমতায় অর্থপূর্ণ পরিবর্তনের ইঙ্গিত দেবে।

রিপোর্টে আরও বলা হয়েছে, Opus 5 আগে অমীমাংসিত পাঁচটি পরিবেশ সমাধান করেছে, যার মধ্যে চারটি মানব-স্তরের বা তারও ওপরে। মানুষেরা দ্রুত বুঝতে পারে এমন কাজকে কেন্দ্র করে তৈরি একটি বেঞ্চমার্কে এই ধরনের অগ্রগতি উল্লেখযোগ্য। এটি কেবল গড় পারফরম্যান্সের উন্নতি নয়, বরং আগের সিস্টেমগুলোর জন্য কঠিন সীমা হিসেবে কাজ করা সমস্যাগুলিও পার হওয়ার সক্ষমতা দেখায়।

পরীক্ষার সময় অস্বাভাবিক আচরণ

উৎস উপাদানের সবচেয়ে চমকপ্রদ দিকগুলোর একটি হলো শীর্ষ স্কোর নয়, বরং কাজ সমাধান করার সময় Opus 5 কীভাবে আচরণ করেছিল তার বর্ণনা। ARC Prize-এর গবেষকরা reportedly দেখেছেন, মডেলটি কাজকে বীজগাণিতিক নোটেশনে রূপান্তর করছিল এবং স্বাধীনভাবে reflection equations গঠন করছিল, যা তারা এই বেঞ্চমার্কে আগে কোনও মডেলের মধ্যে দেখেননি।

এর অর্থ এই নয় যে সিস্টেমটি মানবিক অর্থে গণিত বুঝেছে, বা এটি যন্ত্রচেতনা সম্পর্কে নতুন কোনও তত্ত্ব প্রমাণ করে। তবে এটি কোনও পাজলের পৃষ্ঠতলীয় রূপের ওপর সাধারণ pattern matching-এর তুলনায় আরও নমনীয় অভ্যন্তরীণ কৌশলের ইঙ্গিত দেয়। ব্যবহারিক দিক থেকে এর মানে, সরাসরি পদ্ধতি ব্যর্থ হলে একটি মডেল নিজের জন্য মধ্যবর্তী উপস্থাপনা তৈরি করতে পারে।

এই ক্ষমতা বেঞ্চমার্ক সংস্কৃতির বাইরেও গুরুত্বপূর্ণ। বাস্তব দুনিয়ার পরিবেশে, কার্যকর AI সিস্টেমকে প্রায়ই অস্পষ্ট সমস্যাকে নতুনভাবে সাজাতে, ছোট ছোট ধাপে ভাগ করতে, এবং উত্তর পাওয়ার আগে একাধিক সম্ভাব্য কৌশল পরীক্ষা করতে হয়। যে মডেল স্বতঃস্ফূর্তভাবে বিমূর্ত কাঠামো তৈরি করতে পারে, তা সফ্টওয়্যার কাজ, বৈজ্ঞানিক সহায়তা, রোবোটিক্স পরিকল্পনা, এবং অপারেশনাল সিদ্ধান্ত-সহায়তার জন্য সেই মডেলের চেয়ে বেশি উপযোগী হতে পারে, যে মূলত মুখস্থ সম্পর্কের ওপর নির্ভর করে।

Claude Opus 5 leads the ARC-AGI-3 leaderboard by a wide margin, far ahead of GPT-5.6 Sol (Max) and other competitors. | Image: ARC Prize
Claude Opus 5 leads the ARC-AGI-3 leaderboard by a wide margin, far ahead of GPT-5.6 Sol (Max) and other competitors. | Image: ARC Prize

তবু সতর্কতা প্রয়োজন। অল্পসংখ্যক চোখধাঁধানো উদাহরণ মডেলের আচরণকে বাস্তবের চেয়ে বেশি সঙ্গতিপূর্ণ বা সাধারণ বলে মনে করাতে পারে। পরের প্রশ্ন হল, একই প্রবণতা কি বৃহত্তর মূল্যায়ন এবং কম নিয়ন্ত্রিত ডিপ্লয়মেন্ট প্রেক্ষাপটেও ধারাবাহিকভাবে দেখা যায় কি না।

বিস্তৃত লিডারবোর্ড চিত্র

দেওয়া পাঠ্যে বলা হয়েছে, Opus 5 কেবল ARC-AGI-3-এ GPT-5.6 Sol (Max)-এর উপরে নয়, Anthropic-এর নিজস্ব Fable-class সিস্টেমগুলোকেও ছাড়িয়ে গেছে, যাদের ARC Prize প্রায় 20 শতাংশ স্কোর দেয়। এই অভ্যন্তরীণ তুলনাটি বাইরের তুলনার মতোই গুরুত্বপূর্ণ হতে পারে। এটি ইঙ্গিত করে যে এই অগ্রগতি ল্যাবগুলোর মধ্যে এককালীন র‌্যাঙ্ক পরিবর্তন নয়, বরং Anthropic-এর নিজস্ব মডেল লাইনে পারফরম্যান্সের একটি বৃহত্তর উত্থানের অংশ।

বেঞ্চমার্কের পুরোনো সংস্করণে, উৎস পাঠ বলছে Opus 5 ARC-AGI-2-এ 90.4 শতাংশ এবং ARC-AGI-1-এ 97.5 শতাংশে পৌঁছায়, আগের শীর্ষ স্কোরের সমান হলেও কিছুটা বেশি খরচে। এই তথ্যটি বর্ণনাকে জটিল করে তোলে। নতুন বেঞ্চমার্কটি সম্ভবত মডেলগুলোর মধ্যে আরও স্পষ্ট পার্থক্য তৈরি করছে, আর পুরোনো সংস্করণগুলো শীর্ষ স্তরে আগেই প্রায় স্যাচুরেশনের কাছাকাছি পৌঁছে থাকতে পারে। অন্য কথায়, ARC-AGI-3 হয়তো বেশি কার্যকর, কারণ এটি এখনও অত্যন্ত সক্ষম সিস্টেমগুলোর মধ্যে পার্থক্য করার জায়গা রাখে।

রিপোর্টে আরও বলা হয়েছে, 25টি পাবলিক ডেমো পরিবেশের মধ্যে ছয়টি এখন সমাধান হয়েছে, এবং পূর্ণ ফলাফল, রিপ্লে, ও বেঞ্চমার্কিং কোড জনসাধারণের জন্য উন্মুক্ত। ওই স্বচ্ছতা গুরুত্বপূর্ণ। বেঞ্চমার্ক দাবি তখনই বেশি মূল্যবান হয়, যখন বাইরের গবেষকেরা শুধু শেষ লিডারবোর্ডই নয়, উদাহরণ, রিপ্লে ট্রেস, এবং মূল্যায়ন পদ্ধতিও দেখতে পারেন।

এই ফল কী বোঝায় আর কী বোঝায় না

AI শিল্পের জন্য সবচেয়ে তাৎক্ষণিক শিক্ষা হলো, যুক্তিবোধ-বেঞ্চমার্ক এখনও একটি জীবন্ত প্রতিযোগিতার ক্ষেত্র। গত দুই বছরে মডেল নির্মাতারা চ্যাটের সাবলীলতা ছাড়িয়ে এমন সিস্টেমের দিকে কাজ করেছেন, যা অপরিচিত পরিবেশে চিন্তা করতে, খাপ খাইয়ে নিতে, এবং কাজ করতে পারে। নতুনত্বকে কেন্দ্র করে স্পষ্টভাবে তৈরি একটি বেঞ্চমার্কে এই পরিমাণের উল্লম্ফন অবশ্যই গবেষণা অগ্রাধিকার, বিপণন দাবি, এবং বিনিয়োগকারী বয়ানকে প্রভাবিত করবে।

কিন্তু একটি বেঞ্চমার্কই ক্ষেত্রের অবস্থা নির্ধারণ করে না। ARC-AGI-3 একটি অর্থবহ সংকেত, চূড়ান্ত রায় নয়। এটি নির্ভরযোগ্যতা, নিরাপত্তা, সত্যনিষ্ঠা, বা অর্থনৈতিকভাবে গুরুত্বপূর্ণ কাজের সম্পূর্ণ বিস্তারে পারফরম্যান্স সরাসরি মাপে না। আর বাস্তব উৎপাদন সীমাবদ্ধতার মধ্যে একটি মডেল এই আচরণগুলো কত দক্ষতার সঙ্গে ধরে রাখতে পারে, তাও দেখায় না।

যদি বেঞ্চমার্ক দলের বিশ্লেষণ টিকে যায়, তবে এই ফল দেখায় যে অপরিচিত সমস্যার মধ্য দিয়ে যুক্তি করতে পারে এমন মডেল তৈরির দৌড় নতুন এক পর্যায়ে প্রবেশ করছে। কয়েক মাস ধরে জনপরিসরের আলোচনা অতিরঞ্জন আর অবমূল্যায়নের মধ্যে দুলেছে: হয় AI সাধারণ সক্ষমতার দোরগোড়ায়, নয়তো বেঞ্চমার্কের লাভ আসলে ধোঁয়া। এই ধরনের ফলাফল দুই অবস্থাকেই জটিল করে তোলে। এগুলো সাধারণ বুদ্ধিমত্তা এসে গেছে প্রমাণ করে না, তবে অন্তত বোঝায় যে কিছু সিস্টেমকে এখন আর কেবল অটোকমপ্লিট বলে উড়িয়ে দেওয়া কঠিন হয়ে উঠছে।

পরের প্রশ্ন হলো এই সক্ষমতাগুলো স্থানান্তরিত হয় কি না। যদি হয়, তবে এই স্কোরটি লিডারবোর্ডের আপডেটের চেয়ে বেশি মনে থাকবে এই প্রাথমিক ইঙ্গিত হিসেবে যে যুক্তিবোধের উন্নতি জমা হতে শুরু করেছে। যদি না হয়, তবে এটি সেই দীর্ঘ তালিকার আরেকটি বেঞ্চমার্ক হয়ে থাকবে, যা উত্তাপ তৈরি করেছে কিন্তু AI ডিপ্লয়মেন্টের মৌলিক অর্থনীতি বদলায়নি। আপাতত, এই ফল গুরুত্বপূর্ণ কারণ এটি নির্দিষ্ট, পরিমাপযোগ্য, এবং যথেষ্ট বড় যে ক্ষেত্রের বাকিদের এর জবাব দিতেই হবে।

This article is based on reporting by The Decoder. Read the original article.

Originally published on the-decoder.com