OpenAI म्हणते की त्यांनी ARC-AGI-3 मध्ये आघाडी पुन्हा मिळवली, पण हा बेंचमार्क वाद प्रत्यक्षात टूलिंगबद्दल आहे

OpenAI म्हणते की त्यांच्या GPT-5.6 Sol मॉडेलने ARC-AGI-3 वर 38.3% गुण मिळवले, जो त्याच बेंचमार्कवर Anthropic च्या Claude Opus 5 ने मिळवलेल्या 30.2% पेक्षा जास्त आहे. कागदावर पाहता, हे अमूर्त तर्कशक्तीवरील जवळून पाहिल्या जाणाऱ्या स्पर्धेत एक सरळ उलटफेर वाटतो. प्रत्यक्षात, हा दावा अधिक गुंतागुंतीचा आहे. हा उच्च निकाल GPT-5.6 Sol ला OpenAI च्या स्वतःच्या Responses API आणि बेंचमार्कच्या मानक टेस्ट हार्नेसचा भाग नसलेल्या दोन विशिष्ट सेटिंग्जसह चालवण्यावर अवलंबून आहे.

हा फरक महत्त्वाचा आहे, कारण ARC-AGI-3 हे एखादे मॉडेल अपरिचित तर्क समस्यांशी किती चांगले जुळवून घेते हे मोजण्यासाठी तयार केले आहे, विक्रेत्याने आपल्या मॉडेलला उत्पादन-विशिष्ट पायाभूत सुविधांमध्ये किती चांगले गुंडाळले आहे हे नव्हे. दिलेल्या स्रोत मजकुरानुसार, GPT-5.6 Sol ने अधिकृत हार्नेसमध्ये फक्त 7.8% गुण मिळवले, जिथे प्रत्येक कृतीनंतर मॉडेलची reasoning टाकून दिली जाते. OpenAI चा खूप उच्च गुण “Retained Reasoning” वापरून आला, जे टप्प्यांदरम्यान मॉडेलची chain of thought जपते, आणि “Compaction” वापरून आला, जे जुना context काढून न टाकता त्याचा सारांश करते.

हा निकाल एका leaderboard अपडेटपेक्षा खोलवर जाणारा वाद निर्माण करतो. AI evaluation मध्ये आता मध्यवर्ती बनलेल्या प्रश्नाला तो समोर आणतो: जेव्हा systems memory handling, context management, आणि API design द्वारे सुधारतात, तेव्हा model capability आणि product scaffolding यांच्यातील सीमारेषा कुठे आखायची?

ARC-AGI-3 इतका मोठा वादाचा मुद्दा का बनला आहे

ARC-शैलीच्या बेंचमार्क्सना AI उद्योगात असामान्य स्थान आहे, कारण त्यांचा उद्देश memorization पेक्षा generalization ची चाचणी घेणे हा आहे. हे tasks अशा प्रकारे तयार केलेले आहेत की एखादे system नियमांचा अंदाज लावू शकते आणि नवीन puzzles सोडवू शकते का हे तपासले जाईल, त्यामुळे व्यापक reasoning प्रगतीचे पुरावे शोधणाऱ्या संशोधक आणि विक्रेत्यांसाठी ते विशेष आकर्षक ठरतात. म्हणूनच setup वरचे वाद इतके संवेदनशील होतात. model performance वेगळी करण्यासाठी तयार केलेला बेंचमार्क समजणे कठीण होते, जर एखाद्या provider चा निकाल standard environment च्या बाहेरील features वर अवलंबून असेल.

स्रोत मजकुरात वर्णन केल्याप्रमाणे OpenAI चा युक्तिवाद असा आहे की बेंचमार्क फक्त model मोजत नाहीत. ते त्याच्या भोवतीची तांत्रिक रचना देखील मोजतात. ही भूमिका व्यापक उद्योगवास्तव प्रतिबिंबित करते. deployed products मध्ये models क्वचितच एकटे काम करतात. ते orchestration layers, context windows, retrieval systems, tool use, आणि state management वर अवलंबून असतात. जर बेंचमार्क या घटकांकडे दुर्लक्ष करत असेल, तर विक्रेते योग्यच म्हणू शकतात की तो प्रत्यक्ष जगातील कामगिरी कमी दाखवतो.

पण ARC-AGI-3 प्रत्येक प्रत्यक्ष-जगातील deployment निवड प्रतिबिंबित करण्यासाठी डिझाइन केलेला नव्हता. provider-to-provider तुलना अर्थपूर्ण व्हावी इतपत वातावरण प्रमाणित करण्यासाठी तो तयार केला गेला. म्हणूनच official benchmark harness चर्चेत इतका महत्त्वाचा आहे. जेव्हा OpenAI त्या हार्नेसच्या बाहेर खूपच मजबूत score पोस्ट करते, तेव्हा ते अधिक सक्षम product stack दाखवत असू शकते, पण ते benchmark च्या मूळ नियमांनुसार अधिक मजबूत base model सिद्ध करत असेलच असे नाही.

निकाल बदलणाऱ्या दोन सेटिंग्ज

स्रोत मजकूर या वाढीमागे असलेल्या दोन OpenAI features ची ओळख करून देतो. पहिले, Retained Reasoning, टप्प्यांदरम्यान मॉडेलची chain of thought जपते. दुसरे, Compaction, जुना context truncate करण्याऐवजी त्याचा सारांश करते. एकत्रितपणे, या सेटिंग्जमुळे GPT-5.6 Sol ला अधिकृत हार्नेसमध्ये मागे ठेवणारी कमकुवत बाजू दूर होत असल्याचे दिसते, जिथे प्रत्येक action नंतर मधली reasoning हरवत होती.

अशी persistence बहु-टप्प्यांच्या reasoning tasks मध्ये निर्णायक ठरू शकते. जर एखादे model आधीच्या निष्कर्षांना जपून त्यांना वापरण्यायोग्य context मध्ये संकुचित करू शकत असेल, तर ते स्वतःची internal state पुन्हा पुन्हा बांधण्यापासून वाचू शकते. दुसऱ्या शब्दांत, benchmark चा निकाल puzzle बदलल्यामुळे बदलत नाही; system ला समस्या सोडवताना अधिक प्रभावीपणे लक्षात ठेवण्याची परवानगी मिळाल्यामुळे बदलतो.

GPT-5.6 Sol's ARC-AGI-3 scores jump dramatically when using OpenAI's custom harness with retained reasoning and compaction, compared to the official test harness. | Image: OpenAI
GPT-5.6 Sol's ARC-AGI-3 scores jump dramatically when using OpenAI's custom harness with retained reasoning and compaction, compared to the official test harness. | Image: OpenAI

म्हणून OpenAI चा दावा हा चाचणी होत असलेल्या system नेमका काय आहे याच्या व्यापक व्याख्येवर आधारलेला दिसतो. जर “system” मध्ये विक्रेत्याचे API behavior आणि memory-management features समाविष्ट असतील, तर 38.3% score संबंधित ठरतो. जर “system” म्हणजे neutral standardized interface खालील model असेल, तर अधिकृत 7.8% आकडा अधिक थेट तुलना बिंदू राहतो.

ARC Prize ची प्रतिक्रिया दोन्ही दृष्टीकोनांना जागा देते

दिलेल्या स्रोत मजकुरानुसार ARC Prize चे सह-संस्थापक François Chollet यांनी दोन प्रकारच्या test setups मध्ये फरक करून प्रतिक्रिया दिली. विशेषतः बेंचमार्क सोडवण्यासाठी तयार केलेले custom harnesses, किंवा benchmark format बद्दल माहिती असलेले setup, मान्य नाहीत. त्याउलट, सर्व वापरकर्त्यांना उपलब्ध असलेल्या general-purpose API settings स्वीकार्य आहेत. compaction संदर्भात OpenAI च्या models ची सर्वोत्तम चाचणी कशी करावी यावर ARC Prize आणि OpenAI मध्ये सुरू असलेली चर्चा असल्याचेही त्यांनी सांगितले, आणि कंपनी “starting to figure out the answer” या टप्प्यावर येत असल्याचे त्यांनी स्वागत केले.

ही प्रतिक्रिया महत्त्वाची आहे, कारण ती OpenAI चा score थेट नाकारत नाही. उलट, general-purpose, व्यापकपणे उपलब्ध, आणि खर्चासह पारदर्शकपणे जाहीर केलेल्या provider-specific settings ना ARC Prize वैध मानू शकते, असे ती सूचित करते. त्याच वेळी, स्रोत मजकूर नमूद करतो की वेगवेगळे providers वेगवेगळ्या सेटिंग्ज वापरत असल्याने parity issue निर्माण होऊ शकतो. दुसऱ्या शब्दांत, benchmark आयोजक काही प्रमाणात asymmetry सहन करण्यास तयार दिसतो, जरी ते थेट तुलनेला गुंतागुंतीचे करते हे मान्य करत असला तरी.

यामुळे वाद OpenAI चा निकाल वैध आहे का यापासून, त्या वैधतेचा प्रकार काय आहे याकडे वळतो. GPT-5.6 Sol ला OpenAI च्या सध्याच्या API stack मधून वापरल्यावरची कामगिरी मोजणारा निकाल म्हणून तो वैध असू शकतो. पण वेगवेगळ्या गृहितकांखाली तपासलेल्या models च्या तुलनेत स्वच्छ apples-to-apples benchmark निकाल म्हणून तो कमी स्पष्ट आहे.

AI benchmarking बद्दल आता हे प्रकरण काय सांगते

हा वाद AI evaluation मधील व्यापक बदल दाखवतो. frontier systems अधिक agentic होत असताना आणि दीर्घकालीन workflows वर अधिक अवलंबून असताना, benchmark performance increasingly runtime design choices वर अवलंबून राहील, फक्त underlying model weights वर नाही. Memory retention, context compression, step orchestration, आणि interface design हे सर्व निकाल बदलू शकतात. त्यामुळे एकाच static leaderboard द्वारे vendors ची तुलना करू पाहणाऱ्यांसाठी समस्या निर्माण होते.

याचा अर्थ benchmark consumers नी अधिक नेमके प्रश्न विचारणे आवश्यक आहे. मॉडेल default configuration मध्ये तपासले गेले का? vendor-specific features सक्षम होते का? हार्नेसने intermediate reasoning जपली का? costs आणि settings जाहीर केल्या गेल्या का? अशा context शिवाय headline score पूर्वीइतका माहितीपूर्ण राहिलेला नाही.

OpenAI साठी, ही घोषणा कंपनी Anthropic च्या अलीकडील benchmark momentum ला आव्हान देण्यास कटिबद्ध असल्याचे दाखवते. ARC Prize साठी, ही प्रतिक्रिया modern API realities नुसार नियम जुळवून घेण्याची व्यावहारिक तयारी सूचित करते, बशर्ते त्या जुळवणी benchmark-specific hacks नसाव्यात. आणि व्यापक उद्योगासाठी, धडा हा एका विशिष्ट दिवशी कोण पहिला यापेक्षा, model performance product-layer intelligence वर अवलंबून झाल्यावर “fair” test परिभाषित करणे किती कठीण झाले आहे, याबद्दल अधिक आहे.

यामुळे benchmark अप्रासंगिक ठरत नाही. उलट, disclosure अधिक महत्त्वाचे बनते. OpenAI चा 38.3% score अर्थपूर्ण आहे, कारण तो दाखवतो की GPT-5.6 Sol ची reasoning टिकवून ठेवली गेली आणि context truncate न करता compact केला गेला, तर त्याची कामगिरी खूप चांगली होऊ शकते. अधिकृत 7.8% score अर्थपूर्ण आहे, कारण तो दाखवतो की तोच model बेंचमार्कच्या अधिक कठोर standard harness खाली खूपच खराब कामगिरी करतो. दोन्ही आकडे काहीतरी खरे सांगतात. फक्त ते एकच गोष्ट सांगत नाहीत.

हा लेख The Decoder च्या रिपोर्टिंगवर आधारित आहे. मूळ लेख वाचा.

Originally published on the-decoder.com