OpenAI ARC-AGI-3లో ముందంజను తిరిగి పొందిందని చెబుతోంది, కానీ ఈ బెంచ్‌మార్క్ వివాదం నిజానికి టూలింగ్ గురించే

OpenAI తన GPT-5.6 Sol మోడల్ ARC-AGI-3లో 38.3% సాధించిందని చెబుతోంది, అదే బెంచ్‌మార్క్‌లో Anthropic యొక్క Claude Opus 5 సాధించిన 30.2% కంటే ఇది ఎక్కువ. కాగితంపై చూస్తే, ఇది సారాంశాత్మక తర్కంపై దగ్గరగా గమనిస్తున్న పోటీలో సూటిగా వచ్చిన తిరుగుబాటులా అనిపిస్తుంది. కానీ వాస్తవంలో, ఈ దావా మరింత సంక్లిష్టం. ఈ ఎక్కువ ఫలితం GPT-5.6 Solను OpenAI యొక్క Responses APIతో పాటు బెంచ్‌మార్క్ యొక్క ప్రామాణిక టెస్ట్ హార్నెస్‌లో భాగం కాని రెండు నిర్దిష్ట సెట్టింగ్‌లతో నడిపినందుపైనే ఆధారపడి ఉంది.

ఈ తేడా ముఖ్యమైనది, ఎందుకంటే ARC-AGI-3 ఒక మోడల్ తెలియని తర్క సమస్యలను ఎంత బాగా ఎదుర్కొంటుందో కొలవడానికి రూపొందించబడింది; విక్రేత తన మోడల్‌ను ఉత్పత్తి-నిర్దిష్ట మౌలిక సదుపాయాల చుట్టూ ఎంత బాగా కట్టిపడేస్తాడో కాదు. ఇచ్చిన మూల పాఠ్య ప్రకారం, GPT-5.6 Sol అధికారిక హార్నెస్‌లో కేవలం 7.8% మాత్రమే పొందింది, అక్కడ ప్రతి చర్య తర్వాత మోడల్ యొక్క reasoning విస్మరించబడుతుంది. OpenAI యొక్క చాలా ఎక్కువ స్కోరు “Retained Reasoning” వాడకంతో వచ్చింది, ఇది దశల మధ్య మోడల్ యొక్క chain of thought‌ను నిలుపుతుంది, మరియు “Compaction” వాడకంతో వచ్చింది, ఇది పాత context‌ను తీసివేయకుండా సారాంశం చేస్తుంది.

ఈ ఫలితం ఒక్క leaderboard నవీకరణకన్నా లోతైన చర్చను లేవనెత్తుతుంది. AI evaluation‌లో ఇప్పుడు కేంద్ర ప్రశ్నగా మారినదాన్ని ఇది వెలికితీస్తుంది: systems memory handling, context management, మరియు API design ద్వారా మెరుగుపడుతున్నప్పుడు, model capability మరియు product scaffolding మధ్య గీతను ఎక్కడ గీయాలి?

ARC-AGI-3 ఎందుకు అంత పెద్ద మలుపు బిందువుగా మారింది

ARC-శైలి బెంచ్‌మార్క్‌లకు AI పరిశ్రమలో అసాధారణ స్థానం ఉంది, ఎందుకంటే అవి memorization కంటే generalization‌ను పరీక్షించడానికి ఉద్దేశించబడ్డాయి. ఈ tasks, ఒక system నియమాలను ఊహించి కొత్త puzzles‌ను పరిష్కరించగలదా అనే దాన్ని పరీక్షించేందుకు రూపొందించబడ్డాయి; అందువల్ల విస్తృత reasoning పురోగతికి ఆధారాలను వెతుకుతున్న పరిశోధకులు మరియు విక్రేతలకు ఇవి ఎంతో ఆకర్షణీయంగా ఉంటాయి. అందుకే setup పై వివాదాలు ఇంత సున్నితంగా మారతాయి. model performance‌ను వేరుచేయడానికి రూపొందించిన బెంచ్‌మార్క్, ఒక provider ఫలితం standard environment వెలుపల ఉన్న లక్షణాలపై ఆధారపడితే, అర్థం చేసుకోవడం కష్టమవుతుంది.

మూల పాఠ్యంలో వివరించినట్లుగా, OpenAI యొక్క వాదన ఏమిటంటే బెంచ్‌మార్క్‌లు మోడల్‌ను మాత్రమే కొలవవు. అవి దాని చుట్టూ ఉన్న సాంకేతిక సెటప్‌ను కూడా కొలుస్తాయి. ఇది విస్తృత పరిశ్రమ వాస్తవాన్ని ప్రతిబింబిస్తుంది. deployed products‌లో, models అరుదుగా ఒంటరిగా పనిచేస్తాయి. అవి orchestration layers, context windows, retrieval systems, tool use, మరియు state management‌పై ఆధారపడతాయి. ఒక బెంచ్‌మార్క్ ఈ అంశాలను పరిగణనలోకి తీసుకోకపోతే, విక్రేతలు అది నిజజీవిత పనితీరును తక్కువగా చూపుతుందని సమంజసంగా వాదించగలరు.

కానీ ARC-AGI-3 ప్రతి నిజజీవిత deployment ఎంపికను ప్రతిబింబించేందుకు రూపొందించబడలేదు. provider-to-provider పోలికలు అర్థవంతంగా ఉండేలా వాతావరణాన్ని సరిపడా ప్రామాణీకరించడానికి దీనిని రూపొందించారు. అందుకే అధికారిక benchmark harness ఈ చర్చలో అంత ముఖ్యమైనది. OpenAI ఆ హార్నెస్ వెలుపల ఎంతో బలమైన score‌ను పోస్ట్ చేసినప్పుడు, అది మరింత సామర్థ్యవంతమైన product stack‌ను చూపించవచ్చు; కానీ బెంచ్‌మార్క్ యొక్క అసలు నియమాల కింద మరింత బలమైన base model‌ను నిరూపిస్తున్నట్టే కాదు.

ఫలితాన్ని మార్చిన రెండు సెట్టింగ్‌లు

మూల పాఠ్యం ఈ పెరుగుదలకు వెనుక ఉన్న రెండు OpenAI features‌ను గుర్తిస్తుంది. మొదటిది, Retained Reasoning, దశల మధ్య మోడల్ యొక్క chain of thought‌ను ఉంచుతుంది. రెండవది, Compaction, పాత context‌ను truncate చేయకుండా సంక్షిప్తం చేస్తుంది. కలిసి చూస్తే, ఈ సెట్టింగ్‌లు అధికారిక హార్నెస్‌లో GPT-5.6 Solను వెనక్కి నెట్టిన బలహీనతను పరిష్కరిస్తున్నట్టుగా కనిపిస్తాయి; అక్కడ ప్రతి action తర్వాత మధ్యంతర reasoning కోల్పోయేది.

అలాంటి persistence, బహుళ-దశ reasoning tasks‌లో నిర్ణయాత్మకంగా ఉండవచ్చు. ఒక model ముందు చేసిన నిర్ధారణలను నిలుపుకుని వాటిని ఉపయోగపడే context‌గా కుదించగలిగితే, అది తన అంతర్గత స్థితిని మళ్లీ మళ్లీ నిర్మించాల్సిన అవసరాన్ని తప్పించుకోవచ్చు. మరో మాటలో చెప్పాలంటే, puzzle మారినందువల్ల బెంచ్‌మార్క్ ఫలితం మారలేదు; సమస్యను పరిష్కరిస్తున్నప్పుడు system మరింత సమర్థవంతంగా జ్ఞాపకం ఉంచుకోవడానికి అనుమతి లభించినందువల్ల మారింది.

GPT-5.6 Sol's ARC-AGI-3 scores jump dramatically when using OpenAI's custom harness with retained reasoning and compaction, compared to the official test harness. | Image: OpenAI
GPT-5.6 Sol's ARC-AGI-3 scores jump dramatically when using OpenAI's custom harness with retained reasoning and compaction, compared to the official test harness. | Image: OpenAI

అందువల్ల OpenAI యొక్క దావా పరీక్షకు లోబరచబడుతున్న system నిజంగా ఏమిటనే విస్తృత వ్యాఖ్యానంపై ఆధారపడి ఉన్నట్టుగా కనిపిస్తుంది. “system”లో విక్రేత యొక్క API behavior మరియు memory-management features ఉంటే, 38.3% score సంబంధితమవుతుంది. “system” అనేది neutral standardized interface కింద ఉన్న model‌ను సూచిస్తే, అధికారిక 7.8% అంకెనే మరింత ప్రత్యక్షమైన పోలిక పాయింట్‌గా మిగులుతుంది.

ARC Prize యొక్క స్పందన రెండు దృక్కోణాలకు చోటు ఇస్తుంది

ఇచ్చిన మూల పాఠ్యం ప్రకారం ARC Prize సహ-స్థాపకుడు François Chollet రెండు రకాల test setups మధ్య తేడా చూపిస్తూ స్పందించారు. బెంచ్‌మార్క్‌ను ప్రత్యేకంగా పరిష్కరించడానికి రూపొందించిన custom harnesses, లేదా benchmark format గురించి జ్ఞానం కలిగినవి, అనుమతించబడవు. దీనికి విరుద్ధంగా, అన్ని వినియోగదారులకు అందుబాటులో ఉన్న general-purpose API settings అనుమతించబడతాయి. compaction చుట్టూ OpenAI యొక్క models‌ను ఎలా ఉత్తమంగా test చేయాలనే అంశంపై ARC Prize మరియు OpenAI మధ్య కొనసాగుతున్న చర్చలు ఉన్నాయని, అలాగే కంపెనీ “starting to figure out the answer” అన్న దశకు చేరుకోవడాన్ని ఆయన స్వాగతించారని కూడా తెలిపారు.

ఈ స్పందన ముఖ్యమైనది, ఎందుకంటే ఇది OpenAI యొక్క score‌ను పూర్తిగా తిరస్కరించదు. బదులుగా, general-purpose, విస్తృతంగా అందుబాటులో ఉన్న, మరియు ఖర్చుతో పాటు పారదర్శకంగా వెల్లడించిన provider-specific settings‌ను ARC Prize చట్టబద్ధమైనవిగా చూస్తున్నట్లు సూచిస్తుంది. అదే సమయంలో, వివిధ providers వేర్వేరు సెట్టింగ్‌లను ఉపయోగించడం parity issue‌ను సృష్టిస్తుందని మూల పాఠ్యం గమనిస్తుంది. మరో మాటలో చెప్పాలంటే, benchmark నిర్వాహకుడు కొంత అసమానతను సహించడానికి సిద్ధంగా ఉన్నట్లు కనిపిస్తున్నాడు, అది direct comparisons‌ను సంక్లిష్టతరం చేస్తుందని అంగీకరిస్తూనే.

దీంతో వాదన OpenAI యొక్క ఫలితం చెల్లుబాటవుతుందా అనే ప్రశ్న నుండి, ఆ చెల్లుబాటు ఏ రకమైనదో అనే దానికి మారుతుంది. ఇది GPT-5.6 Solను OpenAI యొక్క ప్రస్తుత API stack ద్వారా ఉపయోగించినప్పుడు దాని పనితీరును కొలిచే రూపంలో చెల్లుబాటు కావచ్చు. కానీ వేర్వేరు ఊహాగానాల కింద test చేసిన models‌తో clean apples-to-apples benchmark result‌గా ఇది అంత స్పష్టంగా లేదు.

ఇప్పుడు AI benchmarking ఏమి చెబుతోంది

ఈ వివాదం AI evaluation‌లో పెద్ద మార్పును చూపిస్తుంది. frontier systems మరింత agentic‌గా, మరియు దీర్ఘకాల workflows‌పై మరింత ఆధారపడేలా మారుతున్న కొద్దీ, benchmark performance ఎక్కువగా runtime design choices‌పై ఆధారపడుతుంది, కేవలం underlying model weights‌పై కాదు. Memory retention, context compression, step orchestration, మరియు interface design అన్నీ ఫలితాలను మార్చగలవు. అది ఒక static leaderboard ద్వారా vendors‌ను పోల్చాలనుకునే వారికోసం సమస్యను సృష్టిస్తుంది.

అది benchmark వినియోగదారులు మరింత నిర్దిష్ట ప్రశ్నలను అడగాల్సిన అవసరాన్ని కూడా సూచిస్తుంది. మోడల్‌ను default configuration‌లో test చేశారా? vendor-specific features enable చేశారా? హార్నెస్ intermediate reasoning‌ను నిలుపుకుందా? ఖర్చులు మరియు సెట్టింగ్‌లు వెల్లడించబడ్డాయా? ఆ context లేకుండా headline score, గతంలో ఉన్నంత సమాచారాన్ని ఇవ్వడం లేదు.

OpenAI కోసం, ఈ ప్రకటన కంపెనీ Anthropic యొక్క ఇటీవలి benchmark momentum‌ను సవాలు చేయడానికి సిద్ధంగా ఉందని చూపిస్తుంది. ARC Prize కోసం, ఈ స్పందన modern API realities‌కు rules‌ను సరిపోల్చుకునే pragmatic willingness‌ను సూచిస్తుంది, అయితే ఆ సర్దుబాట్లు benchmark-specific hacks కాకుండా ఉండాలి. విస్తృత పరిశ్రమకు, పాఠం ఒక నిర్దిష్ట రోజున ఎవరు ముందు ఉన్నారు అనే దానికన్నా, model performance product-layer intelligence‌పై ఆధారపడిన తర్వాత “fair” test‌ను నిర్వచించడం ఎంత కష్టమైందో అనే విషయానికే ఎక్కువగా సంబంధించినది.

అది benchmark అప్రాసంగికమవుతుందని కాదు. అది disclosure‌ను మరింత ముఖ్యమైంది చేస్తుంది. OpenAI యొక్క 38.3% score, GPT-5.6 Sol యొక్క reasoning నిలిపి ఉంచబడినప్పుడు మరియు context truncate చేయకుండా compact చేసినప్పుడు అది చాలా మెరుగ్గా పనిచేయగలదనే ఆధారంగా అర్థవంతమైనది. అధికారిక 7.8% score, అదే మోడల్ బెంచ్‌మార్క్ యొక్క కఠినమైన standard harness కింద చాలా అధ్వాన్నంగా పనిచేస్తుందనే ఆధారంగా అర్థవంతమైనది. రెండు సంఖ్యలూ నిజమైన ఏదో ఒక విషయాన్ని వివరిస్తాయి. అవి కేవలం ఒకే విషయాన్ని వివరించవు.

ఈ వ్యాసం The Decoder నివేదిక ఆధారంగా రూపొందించబడింది. మూల వ్యాసాన్ని చదవండి.

Originally published on the-decoder.com