Claude Opus 5 ने ARC-AGI-3 वर मोठी दरी निर्माण केली

The Decoder च्या कव्हरेजमध्ये उद्धृत बेंचमार्क आयोजकांच्या मते, Anthropic च्या Claude Opus 5 ने ARC-AGI-3 मध्ये 30.2 टक्के असा नोंदवलेला स्कोअर मिळवत अव्वल स्थान पटकावले आहे. हे मागील आघाडीच्या 7.8 टक्के निकालापेक्षा लक्षणीय झेप आहे; त्याच अहवालानुसार तो OpenAI च्या GPT-5.6 Sol (Max) कडे जातो. बेंचमार्कमधील वाढ बहुतेक वेळा टप्प्याटप्प्याने किंवा वादग्रस्त असते अशा क्षेत्रातही, या फरकाचा आकार ठळकपणे जाणवतो.

हा निकाल महत्त्वाचा आहे, कारण ARC-AGI-3 हा साठवलेल्या तथ्यांचा कस नसून, मॉडेलने यापूर्वी न पाहिलेल्या नव्या समस्यांवर किती चांगल्या प्रकारे काम करता येते याचा कस आहे, असे मांडले जाते. ARC Prize ने वर्णन केलेल्या सेटअपमध्ये, मॉडेलला इंटरॅक्टिव्ह वातावरणात ठेवले जाते आणि त्याने नियमांचा अंदाज लावणे, कृतींची योजना करणे, आणि त्या टप्प्याटप्प्याने अमलात आणणे अपेक्षित असते. त्यामुळे हा बेंचमार्क नवीनतेखाली तर्कशक्तीचा संकेत म्हणून उपयुक्त ठरतो, जरी तो अनेक मोजमापांपैकी फक्त एक असला तरी.

बेंचमार्कची कामगिरी एकटी सामान्य बुद्धिमत्तेचा प्रश्न सोडवत नाही, आणि स्कोअरमध्ये रचना, मूल्यांकन, आणि प्रॉम्प्टिंगच्या वैशिष्ट्यांचे प्रतिबिंबही दिसू शकते. पण ताजा निकाल महत्त्वाचा आहे, कारण बेंचमार्क टीम स्वतः फक्त लीडरबोर्डवरील अंतिम आकड्याकडे नाही, तर मॉडेल ज्या पद्धतीने तर्क करते त्या फरकांकडे निर्देश करत आहे.

ARC Prize च्या मते हा निकाल वेगळा का आहे

दिलेल्या स्रोत-पाठ्यानुसार, ARC Prize ने Opus 5 च्या आघाडीचे श्रेय अधिक मजबूत तार्किक तर्कशक्तीला दिले आहे, जी अपरिचित वातावरणात अधिक स्वायत्त अन्वेषण, नियोजन, आणि अंमलबजावणीला पाठबळ देते. हा एक महत्त्वाचा फरक आहे. अलीकडील अनेक AI प्रगती स्केल, टूल वापर, रिट्रिव्हल, किंवा एखाद्या मॉडेलभोवती काळजीपूर्वक तयार केलेल्या सिस्टीम्समधून आल्या आहेत. ARC Prize म्हणते की इथे अधिकृत स्कोअर फक्त भाषा मॉडेलच्या स्वतःच्या कामगिरीची गणना करतात, आणि इतर ठिकाणी निकाल वाढवू शकणारे अतिरिक्त सॉफ्टवेअर हर्नेस वगळतात.

ही सावधगिरी हा बेंचमार्क अजूनही लक्ष का वेधून घेतो ते स्पष्ट करते. मुख्य प्रश्न असा नाही की स्कॅफोल्डिंगसह मॉडेलला कठीण कामे सोडवायला लावता येतील का, तर नवीन परिस्थितीत टाकल्यावर ते स्वतः किती करू शकते हा आहे. जर स्कोअरमधील झेप स्वयं-निर्देशित समस्या सोडवण्यात खरी वाढ दर्शवत असेल, तर ते केवळ बाह्य बदल नव्हे तर क्षमतेतील अर्थपूर्ण परिवर्तन सूचित करेल.

अहवालात असेही म्हटले आहे की Opus 5 ने पूर्वी न सोडवलेल्या पाच वातावरणांची उकल केली, त्यापैकी चार मानव-स्तरावर किंवा त्याहून वर होती. मानव सहसा पटकन समजू शकतील अशा कामांभोवती बांधलेल्या बेंचमार्कमध्ये अशी हालचाल लक्षवेधी आहे. हे फक्त सरासरी कामगिरीत सुधारणा नाही, तर पूर्वीच्या प्रणालींसाठी कठोर मर्यादा ठरलेल्या समस्यांना पार करण्याची क्षमता दाखवते.

चाचणीदरम्यानचे असामान्य वर्तन

स्रोत सामग्रीमधील सर्वात उठून दिसणारी गोष्ट म्हणजे शीर्षक स्कोअर नाही, तर कामे सोडवताना Opus 5 ने कसे वर्तन केले याचे वर्णन. ARC Prize संशोधकांनी कथितपणे पाहिले की मॉडेल कार्यांना बीजगणितीय संकेतांमध्ये रूपांतरित करत होते आणि स्वतंत्रपणे reflection equations तयार करत होते; या बेंचमार्कमध्ये अशी वागणूक त्यांनी यापूर्वी कोणत्याही मॉडेलमध्ये पाहिली नव्हती.

याचा अर्थ प्रणालीने मानवी अर्थाने गणित समजले असा नाही, आणि ते यंत्र-संज्ञानाच्या नव्या सिद्धांताचा पुरावा देत नाही. पण त्यामुळे एखाद्या कोड्यासाठी केवळ पृष्ठभागावरील pattern matching पेक्षा अधिक लवचिक अंतर्गत रणनीती सूचित होते. प्रत्यक्ष परिणाम असा की, थेट पद्धती अपयशी ठरल्यास मॉडेल स्वतःसाठी मधले प्रतिनिधित्व तयार करू शकते.

ती क्षमता बेंचमार्क संस्कृतीपलीकडेही महत्त्वाची ठरेल. प्रत्यक्ष जगात उपयुक्त AI सिस्टीम्सना अनेकदा अस्पष्ट समस्या नव्याने मांडाव्या लागतात, त्यांना लहान टप्प्यांत विभागावे लागते, आणि उत्तर मिळवण्यापूर्वी अनेक संभाव्य धोरणांची चाचणी घ्यावी लागते. प्रामुख्याने लक्षात ठेवलेल्या संबंधांवर अवलंबून असलेल्या मॉडेलपेक्षा, जे मॉडेल स्वयंस्फूर्तपणे अमूर्त संकल्पना तयार करू शकते ते सॉफ्टवेअर कामे, वैज्ञानिक सहाय्य, रोबोटिक्स नियोजन, आणि ऑपरेशनल निर्णय सहाय्यासाठी अधिक योग्य ठरू शकते.

Claude Opus 5 leads the ARC-AGI-3 leaderboard by a wide margin, far ahead of GPT-5.6 Sol (Max) and other competitors. | Image: ARC Prize
Claude Opus 5 leads the ARC-AGI-3 leaderboard by a wide margin, far ahead of GPT-5.6 Sol (Max) and other competitors. | Image: ARC Prize

तरीही, काळजी घेणे आवश्यक आहे. काही आकर्षक उदाहरणे मॉडेलच्या वर्तनाला वास्तवापेक्षा अधिक सुसंगत किंवा सर्वसाधारण दाखवू शकतात. पुढे महत्त्वाचे म्हणजे, हेच कल विस्तृत मूल्यांकनांमध्ये आणि कमी नियंत्रित deployment संदर्भांमध्ये सातत्याने दिसतात का.

विस्तृत लीडरबोर्ड चित्र

दिलेल्या मजकुरात Opus 5 ला ARC-AGI-3 वर फक्त GPT-5.6 Sol (Max) च्याच नव्हे, तर Anthropic च्या स्वतःच्या Fable-class सिस्टीम्सच्याही पुढे ठेवले आहे, ज्यांना ARC Prize सुमारे 20 टक्के स्कोअर देते. ही अंतर्गत तुलना बाह्य तुलनेइतकीच महत्त्वाची असू शकते. यावरून असे सूचित होते की ही वाढ केवळ लॅब्समधील एकदाच झालेला रँक बदल नाही, तर Anthropic च्या स्वतःच्या मॉडेल मालिकेत झालेल्या व्यापक कामगिरी-वाढीचा भाग आहे.

बेंचमार्कच्या जुन्या आवृत्त्यांवर, स्रोत मजकूरानुसार Opus 5 ARC-AGI-2 वर 90.4 टक्के आणि ARC-AGI-1 वर 97.5 टक्के मिळवते, आणि काहीसा जास्त खर्च असूनही आधीच्या सर्वोच्च स्कोअर्सची बरोबरी करते. हा तपशील कथानक अधिक गुंतागुंतीचा करतो. नवीनतम बेंचमार्क मॉडेल्समध्ये अधिक स्पष्ट फरक दाखवत असल्याचे दिसते, तर जुन्या आवृत्त्या कदाचित आधीच वरच्या टोकावर संतृप्ततेच्या जवळ पोहोचल्या असतील. दुसऱ्या शब्दांत, ARC-AGI-3 अधिक उपयुक्त असू शकतो, कारण तो अद्याप उच्च क्षमतेच्या प्रणालींमध्ये फरक ओळखण्यासाठी जागा ठेवतो.

रिपोर्टमध्ये असेही नमूद केले आहे की 25 सार्वजनिक डेमो वातावरणांपैकी सहा आता सोडवले गेले आहेत, आणि संपूर्ण निकाल, रीकास्ट/रीप्ले, आणि बेंचमार्किंग कोड सार्वजनिकपणे उपलब्ध आहेत. त्या बाजूची पारदर्शकता महत्त्वाची आहे. बेंचमार्क दावे तेव्हा अधिक मौल्यवान ठरतात, जेव्हा बाह्य संशोधकांना केवळ अंतिम लीडरबोर्डच नाही तर उदाहरणे, रीप्ले ट्रेसेस, आणि मूल्यांकन पद्धतीही तपासता येतात.

हा निकाल काय सांगतो आणि काय सांगत नाही

AI उद्योगासाठी तात्काळ takeaway म्हणजे तर्कशक्तीचे बेंचमार्क अजूनही एक जिवंत स्पर्धात्मक आघाडी आहेत. गेल्या दोन वर्षांत मॉडेल विकसकांनी चॅटच्या प्रवाहीपणापलीकडे जाऊन अशा प्रणालींकडे लक्ष दिले आहे ज्या अपरिचित सेटिंगमध्ये विचार करू शकतात, जुळवून घेऊ शकतात, आणि कृती करू शकतात. नवीनतेभोवती स्पष्टपणे बांधलेल्या बेंचमार्कवर इतकी मोठी उडी संशोधन प्राधान्यक्रम, मार्केटिंग दावे, आणि गुंतवणूकदारांची मांडणी यांना अपरिहार्यपणे आकार देईल.

पण एकच बेंचमार्क क्षेत्राची स्थिती ठरवत नाही. ARC-AGI-3 हा अर्थपूर्ण संकेत आहे, अंतिम निर्णय नाही. तो विश्वासार्हता, सुरक्षितता, सत्यता, किंवा आर्थिकदृष्ट्या महत्त्वाच्या कामांच्या संपूर्ण पटावरची कामगिरी थेट मोजत नाही. तसेच प्रत्यक्ष उत्पादन मर्यादांखाली हे वर्तन किती कार्यक्षमतेने टिकवता येते हेही दाखवत नाही.

बेंचमार्क टीमचे विश्लेषण टिकून राहिले, तर हा निकाल सांगतो की अपरिचित समस्यांमधून तर्क करू शकणारी मॉडेल्स बनवण्याची शर्यत एका नव्या टप्प्यात प्रवेश करत आहे. महिन्यांपासून सार्वजनिक चर्चा अतिशयोक्ती आणि नाकारण्यामध्ये झुलत आहे: AI सर्वसाधारण क्षमतेच्या उंबरठ्यावर आहे, किंवा बेंचमार्कमधील वाढ म्हणजे फक्त धूर. अशा परिणामांमुळे दोन्ही भूमिकांना गुंतागुंत येते. ते सामान्य बुद्धिमत्ता आली आहे हे सिद्ध करत नाहीत, पण काही प्रणालींना फक्त ऑटोकंप्लीट म्हणून झटकणे कठीण होत चालले आहे, हे मात्र नक्की दाखवतात.

पुढचा प्रश्न असा आहे की ही क्षमता इतर संदर्भातही लागू होते का. तसे झाले, तर हा स्कोअर फक्त लीडरबोर्ड अपडेट म्हणून नाही तर तर्कशक्तीतील सुधारणा एकत्रित होऊ लागल्याचा प्रारंभीचा संकेत म्हणून आठवला जाईल. तसे झाले नाही, तर तो अशा बेंचमार्कच्या दीर्घ यादीतला आणखी एक भाग ठरेल ज्यांनी तापमान वाढवले, पण AI deployment ची मूलभूत अर्थव्यवस्था बदलली नाही. आत्ता हा निकाल महत्त्वाचा आहे, कारण तो विशिष्ट, मोजता येण्यासारखा, आणि एवढा मोठा आहे की उर्वरित क्षेत्राला त्याला उत्तर द्यावे लागेल.

This article is based on reporting by The Decoder. Read the original article.

Originally published on the-decoder.com