GPT-6 Astra मजबूत आंकड़ों, परस्पर विरोधी स्कोरकार्डों, और एक अधिक स्पष्ट दक्षता कहानी के साथ सामने आता है
OpenAI का GPT-6 Astra असामान्य रूप से विरोधाभासी ढंग से लिया जा रहा है: एक benchmark aggregator इसे model field में स्पष्ट रूप से सबसे आगे रखता है, दूसरा कहता है कि यह कुल मिलाकर केवल अपने predecessor के बराबर है, और एक प्रमुख reasoning test पूरी तरह अलग तरह की breakthrough का संकेत देता है। नतीजा वर्तमान AI दौड़ का एक खुलासा करने वाला snapshot है, जहां “कौन-सा model सबसे अच्छा है?” का जवाब increasingly इस पर निर्भर करता है कि क्या मापा जा रहा है और उसे पाने के लिए कितना compute चाहिए।
The Decoder के नए प्रकाशित evaluations के सारांश के अनुसार, Epoch AI 50 से अधिक benchmarks को अपने ECI score में जोड़कर GPT-6 Astra को 169 points के साथ पहले स्थान पर रखता है, 267 models से आगे। इसके विपरीत, Artificial Analysis अपने Intelligence Index में Astra को 61 points देता है, जो Astra के predecessor Sol के बिल्कुल बराबर है, और Anthropic के Claude Fable 5.1 के 66 से पीछे है। यह असहमति कोई छोटी methodological footnote नहीं है। यह इस बात के केंद्र पर प्रहार करती है कि उद्योग frontier progress को अभी कैसे समझता है।
इस विभाजन को समझने की कोशिश कर रहे पाठकों के लिए सबसे सरल व्याख्या यह है कि ये benchmark suites अलग-अलग चीजों पर जोर देते हैं। एक व्यापक composite कई तरह के tasks में लगातार सुधार को पुरस्कृत कर सकता है, जबकि दूसरा knowledge retrieval, coding, या long-context comprehension जैसे चुनिंदा क्षेत्रों में कमजोर प्रदर्शन को अधिक सख्ती से दंडित कर सकता है। इसलिए एक ही model एक framework में निर्णायक नेता और दूसरे में केवल एक lateral move जैसा दिख सकता है।
दक्षता शायद अधिक महत्वपूर्ण संकेत है
दिए गए report में सबसे चौंकाने वाला दावा सिर्फ raw score की स्थिति के बारे में नहीं है। यह efficiency के बारे में है। The Decoder कहता है कि Astra Sol द्वारा उपयोग किए जाने वाले compute steps का लगभग एक-तिहाई इस्तेमाल करता है, और Opus 5 के उपयोग का केवल एक-पांचवां हिस्सा। coding tasks पर, Artificial Analysis के अनुसार Astra ने Claude Fable 5 के बराबर स्कोर किया, जबकि प्रति task लागत आधे से भी कम रही। ऐसा परिणाम महत्वपूर्ण है क्योंकि frontier प्रतियोगिता अब केवल सबसे अच्छा answer पाने के बारे में नहीं है। यह इस बारे में भी है कि उस answer तक कितनी अर्थव्यवस्था से पहुंचा जा सकता है।
यह अंतर model की pricing profile में और स्पष्ट हो जाता है। OpenAI reportedly Astra के लिए processed text की प्रति unit Sol की तुलना में ढाई गुना अधिक शुल्क लेता है, जिससे एक task पहले की तुलना में लगभग 75 प्रतिशत अधिक महंगा हो जाता है। ऊपर से देखने पर, यह लागत में एक बड़ा उछाल लगता है। लेकिन The Decoder का विवरण बताता है कि Astra की compute thrift प्रतियोगी के आधार पर तुलना बदल देती है। अपने predecessor के मुकाबले Astra अधिक महंगा दिखता है। लेकिन उन rival models के मुकाबले जो बहुत अधिक computation खर्च करते हैं, यह कुछ workloads के लिए फिर भी तुलनात्मक रूप से कुशल दिख सकता है।
व्यावहारिक रूप से, यही frontier market का नया तनाव है। एक model API स्तर पर अधिक महंगा हो सकता है और फिर भी कम reasoning steps, कम token consumption, या उच्च-मूल्य वाले tasks पर बेहतर success rates के जरिए value बढ़ा सकता है। developers और enterprise buyers के लिए, ये tradeoffs किसी एक leaderboard position से अधिक मायने रखने वाले हैं।
ARC-AGI-3 ने चर्चा की दिशा बदल दी
report का सबसे अधिक headline-grabbing result ARC-AGI-3 से आता है, जो unfamiliar game worlds के इर्द-गिर्द बना benchmark है। वहां GPT-6 Astra reportedly 62.7 प्रतिशत तक पहुंचा, जो Sol के 7.8 प्रतिशत से बहुत ऊपर और Opus 5 के 30.2 प्रतिशत से भी आगे है। article कहता है कि Astra इस test में पहली बार average human से अधिक efficient था। ARC Prize chief François Chollet को progress की गति को अपनी अपेक्षा से लगभग दोगुना तेज बताया गया है, और अपने AGI forecast को आगे लाने के रूप में वर्णित किया गया है।
उस framing के बावजूद, व्यापक सबक एक नाटकीय percentage के बारे में कम और इस बारे में अधिक है कि किस तरह की ability को पुरस्कृत किया जा रहा है। ARC-style evaluations abstraction और adaptation को परखने के लिए बनाई गई हैं, केवल memorization के लिए नहीं। वहां मजबूत प्रदर्शन का प्रतीकात्मक महत्व है, क्योंकि इसे अक्सर इस सबूत के रूप में माना जाता है कि models training के दौरान देखे गए patterns को केवल दोहरा नहीं रहे, बल्कि unfamiliar structures को संभालने में बेहतर हो रहे हैं।
फिर भी, वही दिया गया text स्पष्ट करता है कि Astra हर जगह समान रूप से मजबूत नहीं है। Artificial Analysis reportedly दिखाता है कि model ने GDPval-AA v2 में लगभग 80 Elo points गंवाए और banking support, SciCode, तथा long-context reasoning tasks में फिसला। यह असमान profile महत्वपूर्ण है। यह संकेत देता है कि Astra हर axis पर सीधा सुधार होने के बजाय अधिक specialized या अधिक aggressively optimized system हो सकता है।
साफ outputs, असमान gains
Astra के अधिक व्यावहारिक सुधारों में से एक उसकी कम hallucination rate हो सकती है। AA-Omniscience में, The Decoder 92 प्रतिशत से 51 प्रतिशत तक की गिरावट रिपोर्ट करता है। यह अभी भी एक पर्याप्त hallucination rate है, लेकिन परिवर्तन इतना बड़ा है कि unsupported assertions जोखिम पैदा करने वाले workflows में operational रूप से मायने रखता है। applied AI teams के लिए, ऐसी कमी leaderboard पर मामूली बढ़त से अधिक मूल्यवान हो सकती है, खासकर research, coding, और business decision support जैसे क्षेत्रों में जहां reliability adoption तय करती है।
report एक कठिन mathematics benchmark पर दुर्लभ प्रदर्शन की ओर भी इशारा करता है। Epoch AI कहता है कि Astra एकमात्र model था जिसने $300-per-attempt budget के भीतर Lean-verified proofs के साथ 68 open FrontierMath Erdős problems में से दो को हल किया। तीन अतिरिक्त solutions, $220,000 से अधिक compute इस्तेमाल करने वाले extra, non-standardized runs में सामने आए, लेकिन वे score में नहीं गिने गए। यह caveat बेहद महत्वपूर्ण है। यह model potential की ऊंचाई और systems की निष्पक्ष तुलना में cost-bounded evaluation के महत्व, दोनों को दिखाता है।
एक model launch जो leaderboard सोच की सीमाएं उजागर करता है
इसलिए शुरुआती Astra तस्वीर न तो साधारण hype है और न ही सीधी disappointment। यह एक case study है कि frontier AI evaluation को एक ही ranking में समेटना क्यों कठिन होता जा रहा है। एक benchmark family कहती है कि Astra नेता है। दूसरी कहती है कि यह अपने predecessor के साथ कुल मिलाकर बराबर है। एक reasoning benchmark efficient problem-solving में असामान्य रूप से महत्वपूर्ण छलांग का संकेत देता है। Task-level measurements coding economy और कम hallucination में gains दिखाती हैं, लेकिन कुछ अन्य क्षेत्रों में regressions भी दिखाती हैं।
यही जटिलता शायद असली कहानी है। जैसे-जैसे models परिपक्व हो रहे हैं, उद्योग उस युग से आगे बढ़ रहा है जहां एक headline score capability के लिए प्रतिनिधि बन सकता था। GPT-6 Astra एक ऐसा model प्रतीत होता है जिसकी अहमियत चुनिंदा advances में है, खासकर efficiency और abstract reasoning के कुछ रूपों के आसपास, न कि हर दिशा में प्रभुत्व में। खरीदारों, शोधकर्ताओं, और प्रतिस्पर्धियों के लिए, यह एक साफ जीत से अधिक दिलचस्प बन जाता है, क्योंकि यह संकेत देता है कि AI दौड़ का अगला चरण असल में कहां तय हो सकता है।
यह article The Decoder की रिपोर्टिंग पर आधारित है। मूल article पढ़ें.
Originally published on the-decoder.com



