GPT-6 Astra শক্তিশালী সংখ্যা, পরস্পরবিরোধী স্কোরকার্ড, এবং আরও স্পষ্ট দক্ষতার গল্প নিয়ে এসেছে

OpenAI-এর GPT-6 Astra অস্বাভাবিকভাবে পরস্পরবিরোধী প্রতিক্রিয়া পাচ্ছে: একটি benchmark aggregator এটিকে model field-এর একেবারে শীর্ষে রাখছে, আরেকটি বলছে এটি মোটের ওপর কেবল তার predecessor-এর সমান, এবং একটি flagship reasoning test একেবারেই ভিন্ন ধরনের breakthrough-এর ইঙ্গিত দিচ্ছে। ফলাফলটি বর্তমান AI প্রতিযোগিতার একটি তাৎপর্যপূর্ণ চিত্র, যেখানে “কোন model সেরা?” প্রশ্নের উত্তর increasingly নির্ভর করছে কী মাপা হচ্ছে এবং তা পেতে কত compute দরকার হচ্ছে তার ওপর।

The Decoder-এর প্রকাশিত নতুন evaluations-এর সারাংশ অনুযায়ী, Epoch AI 50টিরও বেশি benchmark-কে তার ECI score-এ একত্র করে GPT-6 Astra-কে 169 points দিয়ে প্রথম স্থানে রেখেছে, 267 models-এর ওপর। অন্যদিকে, Artificial Analysis তার Intelligence Index-এ Astra-কে 61 points দেয়, যা Astra-এর predecessor Sol-এর সঙ্গে একদম সমান, এবং Anthropic-এর Claude Fable 5.1-এর 66-এর নিচে। এই মতপার্থক্য ছোট কোনো methodological footnote নয়। এটি শিল্প এখন frontier progress-কে কীভাবে ব্যাখ্যা করছে, তার কেন্দ্রে আঘাত করে।

এই বিভাজন বোঝার চেষ্টা করা পাঠকদের জন্য সবচেয়ে সহজ ব্যাখ্যা হলো, এই benchmark suites বিভিন্ন বিষয়ে জোর দেয়। একটি বিস্তৃত composite বিভিন্ন task জুড়ে ধারাবাহিক উন্নতিকে পুরস্কৃত করতে পারে, অন্যটি knowledge retrieval, coding, বা long-context comprehension-এর মতো নির্দিষ্ট ক্ষেত্রে দুর্বল পারফরম্যান্সকে আরও কঠোরভাবে শাস্তি দিতে পারে। ফলে একই model এক framework-এ নির্ণায়ক নেতা এবং অন্যটিতে কেবল সামান্য অগ্রসর পদক্ষেপ হিসেবেও দেখা যেতে পারে।

দক্ষতাই হয়তো বেশি গুরুত্বপূর্ণ সংকেত

দেওয়া প্রতিবেদনের সবচেয়ে চোখে পড়ার মতো দাবি raw score অবস্থান নিয়ে নয়। তা হলো efficiency নিয়ে। The Decoder বলছে Astra, Sol-এর তুলনায় প্রায় এক-তৃতীয়াংশ compute steps ব্যবহার করে, এবং Opus 5-এর ব্যবহারের মাত্র এক-পঞ্চমাংশ। coding task-এ, Artificial Analysis reportedly পেয়েছে Astra, Claude Fable 5-এর সমান স্কোর করেছে, অথচ প্রতি task-এ খরচ হয়েছে অর্ধেকেরও কম। এই ধরনের ফলাফল গুরুত্বপূর্ণ, কারণ frontier প্রতিযোগিতা আর শুধু সেরা উত্তর পাওয়া নিয়ে নয়। এটি সেই উত্তর কত অর্থনৈতিকভাবে পাওয়া যায়, সেটিও নিয়ে।

এই পার্থক্য model-এর pricing profile-এ আরও স্পষ্ট হয়। OpenAI reportedly Astra-এর জন্য processed text-এর এককপ্রতি Sol-এর তুলনায় আড়াই গুণ বেশি চার্জ করে, ফলে একটি task আগের তুলনায় প্রায় 75 শতাংশ বেশি ব্যয়বহুল হয়। বাইরের দৃষ্টিতে, এটি খরচে একটি বড় লাফ। কিন্তু The Decoder-এর বর্ণনা ইঙ্গিত দেয় Astra-এর compute thrift প্রতিদ্বন্দ্বীর ওপর নির্ভর করে তুলনাকে বদলে দেয়। নিজের predecessor-এর বিরুদ্ধে Astra বেশি ব্যয়বহুল দেখায়। কিন্তু অনেক বেশি computation খরচ করা rival models-এর বিরুদ্ধে, নির্দিষ্ট workloads-এর জন্য এটি এখনও তুলনামূলকভাবে দক্ষ বলে মনে হতে পারে।

ব্যবহারিকভাবে, এটাই frontier বাজারের নতুন টানাপড়েন। একটি model API স্তরে বেশি ব্যয়বহুল হতে পারে, তবু কম reasoning steps, কম token consumption, বা উচ্চমূল্যের task-এ ভালো success rates-এর মাধ্যমে value বাড়াতে পারে। developers এবং enterprise buyers-এর জন্য, এই tradeoff-গুলো সম্ভবত যেকোনো একক leaderboard অবস্থানের চেয়ে বেশি গুরুত্বপূর্ণ হবে।

ARC-AGI-3 আলোচনাকে ঘুরিয়ে দেয়

প্রতিবেদনের সবচেয়ে শিরোনাম-আকর্ষণকারী ফলাফল এসেছে ARC-AGI-3 থেকে, যা unfamiliar game worlds ঘিরে তৈরি একটি benchmark। সেখানে GPT-6 Astra reportedly 62.7 শতাংশে পৌঁছেছে, যা Sol-এর 7.8 শতাংশের অনেক উপরে এবং Opus 5-এর 30.2 শতাংশেরও ভালো। article বলছে, Astra এই পরীক্ষায় প্রথমবার average human-এর চেয়ে বেশি efficient ছিল। ARC Prize chief François Chollet-কে বলা হয়েছে, অগ্রগতির গতি তিনি যা আশা করেছিলেন তার প্রায় দ্বিগুণ এবং তিনি তার AGI forecast এগিয়ে এনেছেন।

এই framing সত্ত্বেও, বড় শিক্ষা একক কোনো dramatic percentage নিয়ে নয়, বরং কী ধরনের ability পুরস্কৃত হচ্ছে তা নিয়ে। ARC-style evaluations abstraction ও adaptation যাচাই করার জন্য তৈরি, কেবল memorization-এর জন্য নয়। সেখানে শক্তিশালী পারফরম্যান্সের প্রতীকী গুরুত্ব আছে, কারণ এটি প্রায়ই এই প্রমাণ হিসেবে ধরা হয় যে models training-এর সময় দেখা pattern শুধু পুনরুত্পাদন করছে না, বরং unfamiliar structure সামলাতেও উন্নত হচ্ছে।

তবু, একই সরবরাহকৃত লেখায় স্পষ্ট যে Astra সব জায়গায় সমানভাবে শক্তিশালী নয়। Artificial Analysis reportedly দেখায় মডেল GDPval-AA v2-এ প্রায় 80 Elo points হারিয়েছে এবং banking support, SciCode, ও long-context reasoning tasks-এ পিছিয়েছে। এই অসম প্রোফাইল গুরুত্বপূর্ণ। এটি ইঙ্গিত দেয় Astra হতে পারে একটি বেশি specialized বা বেশি aggressively optimized system, বরং প্রতিটি axis-এ সমান উন্নতি নয়।

পরিষ্কার output, অসমান অগ্রগতি

Astra-এর আরও ব্যবহারিক উন্নতিগুলোর একটি হতে পারে এর কম hallucination rate। AA-Omniscience-এ, The Decoder 92 শতাংশ থেকে 51 শতাংশে নেমে যাওয়ার কথা জানায়। এটি এখনও একটি উল্লেখযোগ্য hallucination rate, কিন্তু পরিবর্তনটি এমন workflow-এ operationally গুরুত্বপূর্ণ যেখানে unsupported assertions ঝুঁকি তৈরি করে। applied AI teams-এর জন্য, এ ধরনের হ্রাস leaderboard-এর সামান্য অগ্রগতির চেয়ে বেশি মূল্যবান হতে পারে, বিশেষ করে research, coding, এবং business decision support-এর মতো ক্ষেত্রে, যেখানে reliability adoption নির্ধারণ করে।

প্রতিবেদনটি একটি কঠিন mathematics benchmark-এ বিরল পারফরম্যান্সের দিকেও ইঙ্গিত করে। Epoch AI বলছে, $300-per-attempt budget-এর মধ্যে Lean-verified proofs সহ 68টি open FrontierMath Erdős problem-এর মধ্যে দুটি সমাধান করতে পেরেছিল একমাত্র model Astra। আরও তিনটি সমাধান extra, non-standardized run-এ পাওয়া যায়, যেখানে $220,000-এর বেশি compute ব্যবহৃত হয়েছিল, কিন্তু সেগুলো score-এ ধরা হয়নি। এই caveat অত্যন্ত গুরুত্বপূর্ণ। এটি model potential-এর সর্বোচ্চ সীমা এবং systems ন্যায্যভাবে তুলনা করতে cost-bounded evaluation-এর গুরুত্ব, দুটোই দেখায়।

একটি model launch যা leaderboard-চিন্তার সীমা প্রকাশ করে

প্রাথমিক Astra চিত্র তাই neither simple hype nor straightforward disappointment। এটি একটি case study, কেন frontier AI evaluation-কে একক ranking-এ গুছিয়ে বলা আরও কঠিন হয়ে উঠেছে। একটি benchmark family বলছে Astra leader। অন্যটি বলছে এটি মোটের ওপর তার predecessor-এর সঙ্গে সমান। একটি reasoning benchmark efficient problem-solving-এ অস্বাভাবিক গুরুত্বপূর্ণ লাফের ইঙ্গিত দিচ্ছে। Task-level measurements coding economy ও কম hallucination-এ অগ্রগতি দেখাচ্ছে, কিন্তু অন্য কিছু ক্ষেত্রে regression-ও দেখাচ্ছে।

এই জটিলতাই সম্ভবত আসল গল্প। মডেল যত পরিপক্ব হচ্ছে, শিল্প এমন এক যুগ পেরোচ্ছে যেখানে একটি headline score-ই capability-এর প্রতিনিধি হয়ে দাঁড়াত। GPT-6 Astra এমন একটি model বলে মনে হচ্ছে যার গুরুত্ব আছে বাছাই করা অগ্রগতিতে, বিশেষ করে efficiency এবং abstract reasoning-এর কিছু রূপে, সর্বজনীন আধিপত্যে নয়। buyers, researchers, এবং competitors-এর জন্য, এটি এক পরিষ্কার জয়ের চেয়ে বেশি আকর্ষণীয়, কারণ এটি ইঙ্গিত দেয় AI প্রতিযোগিতার পরবর্তী ধাপ আসলে কোথায় নির্ধারিত হতে পারে।

এই article The Decoder-এর রিপোর্টিং-এর ভিত্তিতে তৈরি। মূল article পড়ুন.

Originally published on the-decoder.com