OpenAI ARC-AGI-3లో ముందంజను తిరిగి పొందిందని చెబుతోంది, కానీ ఈ బెంచ్మార్క్ వివాదం నిజానికి టూలింగ్ గురించే
OpenAI తన GPT-5.6 Sol మోడల్ ARC-AGI-3లో 38.3% సాధించిందని చెబుతోంది, అదే బెంచ్మార్క్లో Anthropic యొక్క Claude Opus 5 సాధించిన 30.2% కంటే ఇది ఎక్కువ. కాగితంపై చూస్తే, ఇది సారాంశాత్మక తర్కంపై దగ్గరగా గమనిస్తున్న పోటీలో సూటిగా వచ్చిన తిరుగుబాటులా అనిపిస్తుంది. కానీ వాస్తవంలో, ఈ దావా మరింత సంక్లిష్టం. ఈ ఎక్కువ ఫలితం GPT-5.6 Solను OpenAI యొక్క Responses APIతో పాటు బెంచ్మార్క్ యొక్క ప్రామాణిక టెస్ట్ హార్నెస్లో భాగం కాని రెండు నిర్దిష్ట సెట్టింగ్లతో నడిపినందుపైనే ఆధారపడి ఉంది.
ఈ తేడా ముఖ్యమైనది, ఎందుకంటే ARC-AGI-3 ఒక మోడల్ తెలియని తర్క సమస్యలను ఎంత బాగా ఎదుర్కొంటుందో కొలవడానికి రూపొందించబడింది; విక్రేత తన మోడల్ను ఉత్పత్తి-నిర్దిష్ట మౌలిక సదుపాయాల చుట్టూ ఎంత బాగా కట్టిపడేస్తాడో కాదు. ఇచ్చిన మూల పాఠ్య ప్రకారం, GPT-5.6 Sol అధికారిక హార్నెస్లో కేవలం 7.8% మాత్రమే పొందింది, అక్కడ ప్రతి చర్య తర్వాత మోడల్ యొక్క reasoning విస్మరించబడుతుంది. OpenAI యొక్క చాలా ఎక్కువ స్కోరు “Retained Reasoning” వాడకంతో వచ్చింది, ఇది దశల మధ్య మోడల్ యొక్క chain of thoughtను నిలుపుతుంది, మరియు “Compaction” వాడకంతో వచ్చింది, ఇది పాత contextను తీసివేయకుండా సారాంశం చేస్తుంది.
ఈ ఫలితం ఒక్క leaderboard నవీకరణకన్నా లోతైన చర్చను లేవనెత్తుతుంది. AI evaluationలో ఇప్పుడు కేంద్ర ప్రశ్నగా మారినదాన్ని ఇది వెలికితీస్తుంది: systems memory handling, context management, మరియు API design ద్వారా మెరుగుపడుతున్నప్పుడు, model capability మరియు product scaffolding మధ్య గీతను ఎక్కడ గీయాలి?
ARC-AGI-3 ఎందుకు అంత పెద్ద మలుపు బిందువుగా మారింది
ARC-శైలి బెంచ్మార్క్లకు AI పరిశ్రమలో అసాధారణ స్థానం ఉంది, ఎందుకంటే అవి memorization కంటే generalizationను పరీక్షించడానికి ఉద్దేశించబడ్డాయి. ఈ tasks, ఒక system నియమాలను ఊహించి కొత్త puzzlesను పరిష్కరించగలదా అనే దాన్ని పరీక్షించేందుకు రూపొందించబడ్డాయి; అందువల్ల విస్తృత reasoning పురోగతికి ఆధారాలను వెతుకుతున్న పరిశోధకులు మరియు విక్రేతలకు ఇవి ఎంతో ఆకర్షణీయంగా ఉంటాయి. అందుకే setup పై వివాదాలు ఇంత సున్నితంగా మారతాయి. model performanceను వేరుచేయడానికి రూపొందించిన బెంచ్మార్క్, ఒక provider ఫలితం standard environment వెలుపల ఉన్న లక్షణాలపై ఆధారపడితే, అర్థం చేసుకోవడం కష్టమవుతుంది.
మూల పాఠ్యంలో వివరించినట్లుగా, OpenAI యొక్క వాదన ఏమిటంటే బెంచ్మార్క్లు మోడల్ను మాత్రమే కొలవవు. అవి దాని చుట్టూ ఉన్న సాంకేతిక సెటప్ను కూడా కొలుస్తాయి. ఇది విస్తృత పరిశ్రమ వాస్తవాన్ని ప్రతిబింబిస్తుంది. deployed productsలో, models అరుదుగా ఒంటరిగా పనిచేస్తాయి. అవి orchestration layers, context windows, retrieval systems, tool use, మరియు state managementపై ఆధారపడతాయి. ఒక బెంచ్మార్క్ ఈ అంశాలను పరిగణనలోకి తీసుకోకపోతే, విక్రేతలు అది నిజజీవిత పనితీరును తక్కువగా చూపుతుందని సమంజసంగా వాదించగలరు.
కానీ ARC-AGI-3 ప్రతి నిజజీవిత deployment ఎంపికను ప్రతిబింబించేందుకు రూపొందించబడలేదు. provider-to-provider పోలికలు అర్థవంతంగా ఉండేలా వాతావరణాన్ని సరిపడా ప్రామాణీకరించడానికి దీనిని రూపొందించారు. అందుకే అధికారిక benchmark harness ఈ చర్చలో అంత ముఖ్యమైనది. OpenAI ఆ హార్నెస్ వెలుపల ఎంతో బలమైన scoreను పోస్ట్ చేసినప్పుడు, అది మరింత సామర్థ్యవంతమైన product stackను చూపించవచ్చు; కానీ బెంచ్మార్క్ యొక్క అసలు నియమాల కింద మరింత బలమైన base modelను నిరూపిస్తున్నట్టే కాదు.
ఫలితాన్ని మార్చిన రెండు సెట్టింగ్లు
మూల పాఠ్యం ఈ పెరుగుదలకు వెనుక ఉన్న రెండు OpenAI featuresను గుర్తిస్తుంది. మొదటిది, Retained Reasoning, దశల మధ్య మోడల్ యొక్క chain of thoughtను ఉంచుతుంది. రెండవది, Compaction, పాత contextను truncate చేయకుండా సంక్షిప్తం చేస్తుంది. కలిసి చూస్తే, ఈ సెట్టింగ్లు అధికారిక హార్నెస్లో GPT-5.6 Solను వెనక్కి నెట్టిన బలహీనతను పరిష్కరిస్తున్నట్టుగా కనిపిస్తాయి; అక్కడ ప్రతి action తర్వాత మధ్యంతర reasoning కోల్పోయేది.
అలాంటి persistence, బహుళ-దశ reasoning tasksలో నిర్ణయాత్మకంగా ఉండవచ్చు. ఒక model ముందు చేసిన నిర్ధారణలను నిలుపుకుని వాటిని ఉపయోగపడే contextగా కుదించగలిగితే, అది తన అంతర్గత స్థితిని మళ్లీ మళ్లీ నిర్మించాల్సిన అవసరాన్ని తప్పించుకోవచ్చు. మరో మాటలో చెప్పాలంటే, puzzle మారినందువల్ల బెంచ్మార్క్ ఫలితం మారలేదు; సమస్యను పరిష్కరిస్తున్నప్పుడు system మరింత సమర్థవంతంగా జ్ఞాపకం ఉంచుకోవడానికి అనుమతి లభించినందువల్ల మారింది.

అందువల్ల OpenAI యొక్క దావా పరీక్షకు లోబరచబడుతున్న system నిజంగా ఏమిటనే విస్తృత వ్యాఖ్యానంపై ఆధారపడి ఉన్నట్టుగా కనిపిస్తుంది. “system”లో విక్రేత యొక్క API behavior మరియు memory-management features ఉంటే, 38.3% score సంబంధితమవుతుంది. “system” అనేది neutral standardized interface కింద ఉన్న modelను సూచిస్తే, అధికారిక 7.8% అంకెనే మరింత ప్రత్యక్షమైన పోలిక పాయింట్గా మిగులుతుంది.
ARC Prize యొక్క స్పందన రెండు దృక్కోణాలకు చోటు ఇస్తుంది
ఇచ్చిన మూల పాఠ్యం ప్రకారం ARC Prize సహ-స్థాపకుడు François Chollet రెండు రకాల test setups మధ్య తేడా చూపిస్తూ స్పందించారు. బెంచ్మార్క్ను ప్రత్యేకంగా పరిష్కరించడానికి రూపొందించిన custom harnesses, లేదా benchmark format గురించి జ్ఞానం కలిగినవి, అనుమతించబడవు. దీనికి విరుద్ధంగా, అన్ని వినియోగదారులకు అందుబాటులో ఉన్న general-purpose API settings అనుమతించబడతాయి. compaction చుట్టూ OpenAI యొక్క modelsను ఎలా ఉత్తమంగా test చేయాలనే అంశంపై ARC Prize మరియు OpenAI మధ్య కొనసాగుతున్న చర్చలు ఉన్నాయని, అలాగే కంపెనీ “starting to figure out the answer” అన్న దశకు చేరుకోవడాన్ని ఆయన స్వాగతించారని కూడా తెలిపారు.
ఈ స్పందన ముఖ్యమైనది, ఎందుకంటే ఇది OpenAI యొక్క scoreను పూర్తిగా తిరస్కరించదు. బదులుగా, general-purpose, విస్తృతంగా అందుబాటులో ఉన్న, మరియు ఖర్చుతో పాటు పారదర్శకంగా వెల్లడించిన provider-specific settingsను ARC Prize చట్టబద్ధమైనవిగా చూస్తున్నట్లు సూచిస్తుంది. అదే సమయంలో, వివిధ providers వేర్వేరు సెట్టింగ్లను ఉపయోగించడం parity issueను సృష్టిస్తుందని మూల పాఠ్యం గమనిస్తుంది. మరో మాటలో చెప్పాలంటే, benchmark నిర్వాహకుడు కొంత అసమానతను సహించడానికి సిద్ధంగా ఉన్నట్లు కనిపిస్తున్నాడు, అది direct comparisonsను సంక్లిష్టతరం చేస్తుందని అంగీకరిస్తూనే.
దీంతో వాదన OpenAI యొక్క ఫలితం చెల్లుబాటవుతుందా అనే ప్రశ్న నుండి, ఆ చెల్లుబాటు ఏ రకమైనదో అనే దానికి మారుతుంది. ఇది GPT-5.6 Solను OpenAI యొక్క ప్రస్తుత API stack ద్వారా ఉపయోగించినప్పుడు దాని పనితీరును కొలిచే రూపంలో చెల్లుబాటు కావచ్చు. కానీ వేర్వేరు ఊహాగానాల కింద test చేసిన modelsతో clean apples-to-apples benchmark resultగా ఇది అంత స్పష్టంగా లేదు.
ఇప్పుడు AI benchmarking ఏమి చెబుతోంది
ఈ వివాదం AI evaluationలో పెద్ద మార్పును చూపిస్తుంది. frontier systems మరింత agenticగా, మరియు దీర్ఘకాల workflowsపై మరింత ఆధారపడేలా మారుతున్న కొద్దీ, benchmark performance ఎక్కువగా runtime design choicesపై ఆధారపడుతుంది, కేవలం underlying model weightsపై కాదు. Memory retention, context compression, step orchestration, మరియు interface design అన్నీ ఫలితాలను మార్చగలవు. అది ఒక static leaderboard ద్వారా vendorsను పోల్చాలనుకునే వారికోసం సమస్యను సృష్టిస్తుంది.
అది benchmark వినియోగదారులు మరింత నిర్దిష్ట ప్రశ్నలను అడగాల్సిన అవసరాన్ని కూడా సూచిస్తుంది. మోడల్ను default configurationలో test చేశారా? vendor-specific features enable చేశారా? హార్నెస్ intermediate reasoningను నిలుపుకుందా? ఖర్చులు మరియు సెట్టింగ్లు వెల్లడించబడ్డాయా? ఆ context లేకుండా headline score, గతంలో ఉన్నంత సమాచారాన్ని ఇవ్వడం లేదు.
OpenAI కోసం, ఈ ప్రకటన కంపెనీ Anthropic యొక్క ఇటీవలి benchmark momentumను సవాలు చేయడానికి సిద్ధంగా ఉందని చూపిస్తుంది. ARC Prize కోసం, ఈ స్పందన modern API realitiesకు rulesను సరిపోల్చుకునే pragmatic willingnessను సూచిస్తుంది, అయితే ఆ సర్దుబాట్లు benchmark-specific hacks కాకుండా ఉండాలి. విస్తృత పరిశ్రమకు, పాఠం ఒక నిర్దిష్ట రోజున ఎవరు ముందు ఉన్నారు అనే దానికన్నా, model performance product-layer intelligenceపై ఆధారపడిన తర్వాత “fair” testను నిర్వచించడం ఎంత కష్టమైందో అనే విషయానికే ఎక్కువగా సంబంధించినది.
అది benchmark అప్రాసంగికమవుతుందని కాదు. అది disclosureను మరింత ముఖ్యమైంది చేస్తుంది. OpenAI యొక్క 38.3% score, GPT-5.6 Sol యొక్క reasoning నిలిపి ఉంచబడినప్పుడు మరియు context truncate చేయకుండా compact చేసినప్పుడు అది చాలా మెరుగ్గా పనిచేయగలదనే ఆధారంగా అర్థవంతమైనది. అధికారిక 7.8% score, అదే మోడల్ బెంచ్మార్క్ యొక్క కఠినమైన standard harness కింద చాలా అధ్వాన్నంగా పనిచేస్తుందనే ఆధారంగా అర్థవంతమైనది. రెండు సంఖ్యలూ నిజమైన ఏదో ఒక విషయాన్ని వివరిస్తాయి. అవి కేవలం ఒకే విషయాన్ని వివరించవు.
ఈ వ్యాసం The Decoder నివేదిక ఆధారంగా రూపొందించబడింది. మూల వ్యాసాన్ని చదవండి.
Originally published on the-decoder.com


