OpenAI का कहना है कि उसने ARC-AGI-3 में बढ़त फिर हासिल कर ली है, लेकिन यह विवाद असल में टूलिंग को लेकर है

OpenAI का कहना है कि उसके GPT-5.6 Sol मॉडल ने ARC-AGI-3 पर 38.3% स्कोर हासिल किया, जो उसे उसी बेंचमार्क पर Anthropic के Claude Opus 5 के 30.2% से आगे रखेगा। कागज़ पर देखें तो यह अमूर्त तर्कशक्ति को लेकर करीबी मुकाबले में एक सीधा उलटफेर लगता है। लेकिन व्यवहार में यह दावा ज्यादा जटिल है। यह ऊंचा परिणाम GPT-5.6 Sol को OpenAI के अपने Responses API और दो विशिष्ट सेटिंग्स के साथ चलाने पर निर्भर है, जो बेंचमार्क के मानक टेस्ट हार्नेस का हिस्सा नहीं हैं।

यह अंतर इसलिए महत्वपूर्ण है क्योंकि ARC-AGI-3 इस बात को मापने के लिए बनाया गया है कि कोई मॉडल अपरिचित तर्क समस्याओं को कितनी अच्छी तरह संभालता है, न कि कोई विक्रेता अपने मॉडल को उत्पाद-विशिष्ट इन्फ्रास्ट्रक्चर में कितनी अच्छी तरह लपेट सकता है। दिए गए स्रोत पाठ के अनुसार, आधिकारिक हार्नेस में GPT-5.6 Sol का स्कोर केवल 7.8% था, जहां हर क्रिया के बाद मॉडल की reasoning हटा दी जाती है। OpenAI का कहीं अधिक ऊंचा स्कोर “Retained Reasoning” के उपयोग से आया, जो चरणों के बीच मॉडल की chain of thought को सुरक्षित रखता है, और “Compaction” से, जो पुराने context को हटाने के बजाय उसका सार बनाता है।

यह परिणाम एक ऐसे विवाद की ओर इशारा करता है जो सिर्फ एक leaderboard अपडेट से कहीं गहरा है। यह AI मूल्यांकन में अब केंद्रीय हो चुके प्रश्न को उठाता है: जब सिस्टम memory handling, context management, और API design के जरिए बेहतर होते हैं, तो model capability और product scaffolding के बीच रेखा कहां खींची जानी चाहिए?

ARC-AGI-3 इतना बड़ा विवाद क्यों बन गया है

ARC-शैली के बेंचमार्क AI उद्योग में असामान्य महत्व रखते हैं क्योंकि वे memorization के बजाय generalization को परखने की कोशिश करते हैं। इन कार्यों का उद्देश्य यह जांचना होता है कि कोई सिस्टम नियमों का अनुमान लगाकर नई पहेलियां हल कर सकता है या नहीं, इसलिए वे व्यापक reasoning प्रगति के सबूत तलाश रहे शोधकर्ताओं और विक्रेताओं के लिए विशेष रूप से आकर्षक हैं। यही कारण है कि setup को लेकर विवाद इतने संवेदनशील हो जाते हैं। जो बेंचमार्क model performance को अलग करने के लिए बनाया गया है, वह तब समझना कठिन हो जाता है जब एक प्रदाता का परिणाम मानक वातावरण से बाहर की सुविधाओं पर निर्भर हो।

स्रोत पाठ में वर्णित OpenAI का तर्क यह है कि बेंचमार्क कभी सिर्फ मॉडल को नहीं मापते। वे उसके आसपास मौजूद तकनीकी setup को भी मापते हैं। यह रुख उद्योग की व्यापक वास्तविकता को दर्शाता है। तैनात उत्पादों में, मॉडल शायद ही कभी अकेले काम करते हैं। वे orchestration layers, context windows, retrieval systems, tool use, और state management पर निर्भर होते हैं। अगर कोई बेंचमार्क इन घटकों को नज़रअंदाज़ करता है, तो विक्रेता यह तर्क दे सकते हैं कि वह वास्तविक दुनिया के प्रदर्शन को कम करके आंकता है।

लेकिन ARC-AGI-3 को हर वास्तविक-विश्व deployment विकल्प को प्रतिबिंबित करने के लिए नहीं बनाया गया था। इसे इतना मानकीकृत वातावरण बनाने के लिए डिजाइन किया गया था कि प्रदाताओं के बीच तुलना सार्थक हो सके। इसी कारण आधिकारिक benchmark harness इस चर्चा में इतना महत्वपूर्ण है। जब OpenAI उस हार्नेस के बाहर कहीं अधिक मजबूत स्कोर पोस्ट करता है, तो वह एक अधिक सक्षम product stack दिखा सकता है, लेकिन वह जरूरी नहीं कि बेंचमार्क के मूल नियमों के तहत एक मजबूत base model साबित कर रहा हो।

वे दो सेटिंग्स जिन्होंने नतीजा बदल दिया

स्रोत पाठ में इस बढ़त के पीछे OpenAI की दो सुविधाओं का उल्लेख है। पहली, Retained Reasoning, मॉडल की chain of thought को चरणों के बीच बनाए रखती है। दूसरी, Compaction, पुराने context को काटने के बजाय उसका सार प्रस्तुत करती है। साथ मिलकर ये सेटिंग्स उस कमजोरी को संबोधित करती दिखती हैं जिसने आधिकारिक हार्नेस में GPT-5.6 Sol को पीछे रखा था, जहां हर क्रिया के बाद intermediate reasoning खो जाती थी।

ऐसी persistence बहु-चरणीय reasoning कार्यों में निर्णायक हो सकती है। यदि कोई मॉडल पहले के निष्कर्षों को सुरक्षित रख सके और उन्हें उपयोगी context में संक्षेपित कर सके, तो उसे बार-बार अपनी आंतरिक स्थिति को फिर से बनाने से बचाव मिल सकता है। दूसरे शब्दों में, बेंचमार्क परिणाम इसलिए नहीं बदलता कि पहेली बदल गई, बल्कि इसलिए कि समस्या हल करते समय सिस्टम को अधिक प्रभावी ढंग से याद रखने की अनुमति मिल जाती है।

OpenAI के custom harness में retained reasoning और compaction का उपयोग करने पर GPT-5.6 Sol के ARC-AGI-3 स्कोर में भारी बढ़त आती है, जबकि आधिकारिक test harness में ऐसा नहीं होता। | Image: OpenAI
OpenAI के custom harness में retained reasoning और compaction का उपयोग करने पर GPT-5.6 Sol के ARC-AGI-3 स्कोर में भारी बढ़त आती है, जबकि आधिकारिक test harness में ऐसा नहीं होता। | Image: OpenAI

इसलिए OpenAI का दावा इस व्यापक व्याख्या पर टिका दिखता है कि वास्तव में किस सिस्टम का परीक्षण किया जा रहा है। यदि “system” में विक्रेता का API व्यवहार और memory-management सुविधाएं शामिल हैं, तो 38.3% का स्कोर प्रासंगिक है। यदि “system” को तटस्थ, मानकीकृत interface के तहत model माना जाना चाहिए, तो आधिकारिक 7.8% आंकड़ा अधिक प्रत्यक्ष तुलना बिंदु बना रहता है।

ARC Prize की प्रतिक्रिया दोनों दृष्टिकोणों के लिए जगह छोड़ती है

दिए गए स्रोत पाठ के अनुसार ARC Prize के सह-संस्थापक François Chollet ने दो प्रकार के test setups के बीच अंतर करते हुए प्रतिक्रिया दी। विशेष रूप से बेंचमार्क को हल करने के लिए बनाए गए custom harnesses, या जिनमें benchmark format के बारे में जानकारी हो, वे अनुमति योग्य नहीं हैं। इसके विपरीत, सामान्य-उद्देश्य API settings जो सभी उपयोगकर्ताओं के लिए उपलब्ध हैं, स्वीकार्य हैं। Chollet ने यह भी कहा कि ARC Prize OpenAI के साथ उसके models को कैसे टेस्ट किया जाए, विशेष रूप से compaction के संदर्भ में, इस पर लगातार चर्चा कर रहा है, और कंपनी के “starting to figure out the answer” की सराहना की।

यह प्रतिक्रिया उल्लेखनीय है क्योंकि यह OpenAI के स्कोर को सीधे खारिज नहीं करती। इसके बजाय, यह संकेत देती है कि ARC Prize कुछ provider-specific settings को वैध मानता है, बशर्ते वे सामान्य-उद्देश्य वाली, व्यापक रूप से उपलब्ध, और लागत सहित पारदर्शी रूप से रिपोर्ट की गई हों। साथ ही, स्रोत पाठ बताता है कि अलग-अलग प्रदाताओं द्वारा अलग-अलग settings का उपयोग parity issue पैदा कर सकता है। दूसरे शब्दों में, benchmark organizer कुछ असमानता सहने को तैयार दिखता है, जबकि यह भी स्वीकार करता है कि इससे सीधी तुलना जटिल हो जाती है।

इससे तर्क OpenAI के परिणाम की वैधता से हटकर इस पर आ जाता है कि उस वैधता का प्रकार क्या है। यह GPT-5.6 Sol के OpenAI की मौजूदा API stack के माध्यम से परीक्षण का एक मान्य माप हो सकता है। लेकिन अलग-अलग मान्यताओं के तहत टेस्ट किए गए मॉडलों के विरुद्ध इसे साफ़, apples-to-apples benchmark परिणाम कहना कम स्पष्ट है।

यह प्रकरण अब AI benchmarking के बारे में क्या बताता है

यह विवाद AI मूल्यांकन में एक व्यापक बदलाव को दर्शाता है। जैसे-जैसे frontier systems अधिक agentic और long-horizon workflows पर अधिक निर्भर होते जा रहे हैं, benchmark performance increasingly runtime design choices पर निर्भर करेगी, न कि केवल underlying model weights पर। Memory retention, context compression, step orchestration, और interface design सभी नतीजों को बदल सकते हैं। इससे उन लोगों के लिए समस्या पैदा होती है जो एक ही स्थिर leaderboard के जरिए विक्रेताओं की तुलना करना चाहते हैं।

इसका मतलब यह भी है कि benchmark उपयोगकर्ताओं को अधिक सटीक सवाल पूछने होंगे। क्या model को default configuration में टेस्ट किया गया था? क्या vendor-specific features सक्षम थे? क्या हार्नेस ने intermediate reasoning को सुरक्षित रखा? क्या लागत और सेटिंग्स का खुलासा किया गया? बिना उस संदर्भ के headline score अब पहले की तुलना में कम सूचनात्मक होता जा रहा है।

OpenAI के लिए, यह घोषणा दिखाती है कि कंपनी Anthropic की हाल की benchmark गति को चुनौती देने के लिए दृढ़ है। ARC Prize के लिए, प्रतिक्रिया आधुनिक API वास्तविकताओं के अनुरूप नियमों को ढालने की व्यावहारिक इच्छा दर्शाती है, बशर्ते अनुकूलन benchmark-specific hacks न हों। और व्यापक उद्योग के लिए, सबक किसी विशेष दिन पहले कौन है, इससे कम और इस बात से ज्यादा जुड़ा है कि model performance product-layer intelligence पर निर्भर होने के बाद एक “fair” test को परिभाषित करना कितना कठिन हो गया है।

इससे benchmark अप्रासंगिक नहीं हो जाता। इससे disclosure अधिक महत्वपूर्ण हो जाता है। OpenAI का 38.3% स्कोर इस बात का अर्थपूर्ण प्रमाण है कि GPT-5.6 Sol तब कहीं बेहतर प्रदर्शन कर सकता है जब उसकी reasoning सुरक्षित रखी जाए और उसका context truncate करने के बजाय compact किया जाए। आधिकारिक 7.8% स्कोर यह अर्थपूर्ण प्रमाण है कि वही मॉडल बेंचमार्क के अधिक सख्त standard harness के तहत काफी खराब प्रदर्शन करता है। दोनों आंकड़े कुछ वास्तविक बताते हैं। वे बस एक ही चीज़ नहीं बताते।

यह लेख The Decoder की रिपोर्टिंग पर आधारित है। मूल लेख पढ़ें.

Originally published on the-decoder.com