Claude Opus 5, ARC-AGI-3పై విస్తృతమైన ఆధిక్యాన్ని తెరిచింది
The Decoder కవరేజీలో పేర్కొన్న బెంచ్మార్క్ నిర్వాహకుల ప్రకారం, Anthropic యొక్క Claude Opus 5 ARC-AGI-3లో 30.2 శాతం నివేదిత స్కోర్తో అగ్రస్థానాన్ని దక్కించుకుంది. ఇది మునుపటి అగ్ర ఫలితం 7.8 శాతం నుంచి గణనీయమైన ఎగబాకింపు, అదే నివేదికలో అది OpenAI యొక్క GPT-5.6 Sol (Max) కు చెందినదిగా పేర్కొంది. బెంచ్మార్క్ లాభాలు చాలాసార్లు క్రమంగా లేదా వివాదాస్పదంగా ఉండే రంగంలో కూడా, ఈ తేడా పరిమాణం ప్రత్యేకంగా కనిపిస్తోంది.
ఈ ఫలితం ముఖ్యమైనది, ఎందుకంటే ARC-AGI-3ను నిల్వ చేసిన వాస్తవాల పరీక్షగా కాకుండా, ఒక మోడల్ ముందుగా చూడని కొత్త సమస్యలను ఎంత బాగా ఎదుర్కొగలదో పరీక్షించేలా రూపొందించారు. ARC Prize వివరించిన సెటప్లో, మోడల్ను ఇంటరాక్టివ్ వాతావరణాల్లో ఉంచి, నియమాలను అంచనా వేయాలి, చర్యలను ప్రణాళిక చేయాలి, వాటిని దశలవారీగా అమలు చేయాలి. అందువల్ల, ఈ బెంచ్మార్క్ కొత్తదనం మధ్య తర్కశక్తికి సంకేతంగా ఉపయోగపడుతుంది, అయినా ఇది అనేక కొలమానాల్లో ఒకటిగానే మిగులుతుంది.
బెంచ్మార్క్ పనితీరు మాత్రమే సాధారణ మేధస్సు ప్రశ్నను పరిష్కరించదు, స్కోర్లు రూపకల్పన, మూల్యాంకనం, మరియు ప్రాంప్టింగ్లోని ప్రత్యేకతలను కూడా ప్రతిబింబించవచ్చు. అయితే తాజా ఫలితం ముఖ్యమైనది, ఎందుకంటే బెంచ్మార్క్ బృందమే లీడర్బోర్డులోని తుది సంఖ్యకే కాకుండా, మోడల్ తర్కించే విధానంలో ఉన్న తేడాలకూ సంకేతం ఇస్తోంది.
ఫలితం ఎందుకు భిన్నమని ARC Prize చెబుతోంది
ఇచ్చిన మూల పాఠ్యం ప్రకారం, Opus 5 యొక్క ఆధిక్యాన్ని ARC Prize మరింత బలమైన తార్కిక తర్కశక్తికి ఆపాదిస్తోంది, ఇది అపరిచిత వాతావరణాల్లో మరింత స్వయంచాలక అన్వేషణ, ప్రణాళిక, మరియు అమలుకు తోడ్పడుతుంది. ఇది ముఖ్యమైన భేదం. ఇటీవలి అనేక AI పురోగతులు స్కేలు, సాధన వినియోగం, రిట్రీవల్, లేదా ఒక మోడల్ చుట్టూ జాగ్రత్తగా ఇంజినీర్ చేసిన వ్యవస్థల నుండి వచ్చాయి. ఇక్కడ అధికారిక స్కోర్లు భాషా మోడల్ తనంతట తానే చేసిన పనితీరునే లెక్కలోకి తీసుకుంటాయని, ఇతరత్రా ఫలితాలను పెంచే అదనపు సాఫ్ట్వేర్ హార్నెస్లను మినహాయిస్తాయని ARC Prize అంటోంది.
ఆ హెచ్చరిక ఈ బెంచ్మార్క్ ఇప్పటికీ దృష్టిని ఎందుకు ఆకర్షిస్తుందో వివరిస్తుంది. ప్రధాన ప్రశ్న, సహాయక నిర్మాణాలతో కఠిన పనులను మోడల్ చేయించగలమా అన్నది కాదు, కొత్త పరిస్థితిలో వదిలినప్పుడు అది తనంతట తాను ఎంత చేయగలదన్నదే. స్కోర్ జంప్ నిజమైన స్వీయ-నిర్దేశిత సమస్య పరిష్కార పెరుగుదలని ప్రతిబింబిస్తే, అది కేవలం అలంకారపూరిత మెరుగుదల కాకుండా సామర్థ్యంలో గణనీయమైన మార్పును సూచిస్తుంది.
ఈ మోడల్ ముందు పరిష్కరించని ఐదు వాతావరణాలను పరిష్కరించిందని, వాటిలో నాలుగు మానవ స్థాయిలో లేదా అంతకన్నా పైగా ఉన్నాయని కూడా నివేదిక చెబుతోంది. మానవులు తరచుగా త్వరగా అర్థం చేసుకోగల పనులపై ఆధారిత బెంచ్మార్క్లో ఇలాంటి కదలిక గమనార్హం. ఇది కేవలం సగటు పనితీరు మెరుగుదలనే కాదు, గత వ్యవస్థలకు గట్టి పైకప్పులుగా నిలిచిన సమస్యలను దాటగల సామర్థ్యాన్ని సూచిస్తుంది.
పరీక్ష సమయంలో అసాధారణ ప్రవర్తన
మూల పదార్థంలో అత్యంత ఆసక్తికరమైన అంశాల్లో ఒకటి హెడ్లైన్ స్కోరు కాదు, పనులను పరిష్కరిస్తున్నప్పుడు Opus 5 ఎలా ప్రవర్తించిందో చెప్పిన వివరణ. ARC Prize పరిశోధకులు, మోడల్ పనులను బీజగణిత సంకేతాలుగా మార్చి, స్వతంత్రంగా reflection equations రూపొందించిందని గమనించినట్లు నివేదించబడింది; ఈ బెంచ్మార్క్లో ఇలాంటి ప్రవర్తనను మునుపెన్నడూ చూడలేదని వారు చెప్పారు.
అది వ్యవస్థ మానవ భావంలో గణితాన్ని అర్థం చేసుకుందని అర్థం కాదు, లేదా యంత్ర జ్ఞానంపై కొత్త సిద్ధాంతాన్ని నిరూపించదు. కానీ పజిల్ యొక్క ఉపరితల రూపంపై సాదా pattern matching కంటే మరింత సౌకర్యవంతమైన అంతర్గత వ్యూహాన్ని సూచిస్తుంది. ప్రాయోగికంగా దాని అర్థం ఏమిటంటే, నేరుగా చేసే ప్రయత్నాలు విఫలమైనప్పుడు, మోడల్ తనకోసం మధ్యవర్తి ప్రతినిధులను తానే సృష్టించుకోవచ్చు.
అటువంటి సామర్థ్యం బెంచ్మార్క్ సంస్కృతిని మించి ప్రభావం చూపుతుంది. వాస్తవ ప్రపంచ పరిస్థితుల్లో, ఉపయోగకరమైన AI వ్యవస్థలు తరచూ అస్పష్ట సమస్యలను మళ్లీ రూపకల్పన చేయాలి, వాటిని చిన్న దశలుగా విభజించాలి, మరియు సమాధానానికి చేరుకునే ముందు అనేక సంభావ్య వ్యూహాలను పరీక్షించాలి. ఎక్కువగా గుర్తుంచుకున్న సంబంధాలపై ఆధారపడే మోడల్ కంటే, స్వయంగా అబ్స్ట్రాక్షన్లను సృష్టించగల మోడల్ సాఫ్ట్వేర్ పనులు, శాస్త్రీయ సహాయం, రోబోటిక్స్ ప్రణాళిక, మరియు ఆపరేషనల్ నిర్ణయ మద్దతుకు మరింత అనుకూలంగా ఉండవచ్చు.

అయితే, జాగ్రత్త అవసరం. చిన్న కానీ ఆకర్షణీయమైన ఉదాహరణల సమాహారం మోడల్ ప్రవర్తనను వాస్తవానికి కంటే మరింత సజావుగా లేదా సాధారణంగా కనిపించేలా చేయవచ్చు. తర్వాత ముఖ్యమైనది ఏమిటంటే, అదే ధోరణులు విస్తృత మూల్యాంకనాల్లో మరియు తక్కువ నియంత్రిత డిప్లాయ్మెంట్ సందర్భాల్లో స్థిరంగా కనిపిస్తాయా అనేది.
విస్తృత లీడర్బోర్డ్ దృశ్యం
ఇచ్చిన పాఠ్యం ప్రకారం, Opus 5 ARC-AGI-3లో GPT-5.6 Sol (Max) కంటే మాత్రమే కాకుండా, ARC Prize చెప్పిన Anthropic యొక్క Fable-class వ్యవస్థల కంటే కూడా ముందుంది; వాటి స్కోరు సుమారు 20 శాతం. ఈ అంతర్గత పోలిక బాహ్య పోలికంతే ముఖ్యమైనదై ఉండవచ్చు. ఇది ఈ లాభం ఒకసారి ల్యాబ్ల మధ్య ర్యాంక్ మార్పు మాత్రమే కాకుండా, Anthropic యొక్క స్వంత మోడల్ లైనప్లో పనితీరు విస్తృతంగా పెరిగిన భాగమని సూచిస్తుంది.
బెంచ్మార్క్ పాత సంచికల్లో, మూల పాఠ్యం ప్రకారం Opus 5 ARC-AGI-2పై 90.4 శాతం మరియు ARC-AGI-1పై 97.5 శాతం సాధించింది; ఇది మునుపటి అత్యుత్తమ స్కోర్లను సమానంగా చేరుకున్నప్పటికీ, కొంచెం అధిక ఖర్చుతో. ఆ వివరమే కథనాన్ని సంక్లిష్టం చేస్తుంది. తాజా బెంచ్మార్క్ మోడళ్లను మరింత స్పష్టంగా వేరు చేస్తోంది, అయితే పాత సంచికలు ఇప్పటికే శిఖర భాగంలో సాచురేషన్కు దగ్గరగా ఉండి ఉండవచ్చు. మరో మాటలో, ARC-AGI-3 మరింత ఉపయోగకరంగా ఉండొచ్చు, ఎందుకంటే అది అత్యంత సామర్థ్యవంతమైన వ్యవస్థల మధ్య తేడాను చూపేందుకు ఇంకా స్థలం ఇస్తుంది.
రిపోర్ట్ ఇంకా చెబుతోంది: 25 పబ్లిక్ డెమో వాతావరణాల్లో ఆరు ఇప్పటివరకు పరిష్కరించబడ్డాయి, మరియు పూర్తి ఫలితాలు, రీప్లేలు, బెంచ్మార్కింగ్ కోడ్ ప్రజలకు అందుబాటులో ఉన్నాయి. ఆ పారదర్శకత ముఖ్యం. తుది లీడర్బోర్డు మాత్రమే కాకుండా, ఉదాహరణలు, రీప్లే ట్రేసులు, మరియు మూల్యాంకన విధానాన్ని కూడా బయటి పరిశోధకులు పరిశీలించగలిగితేనే బెంచ్మార్క్ దావాలు మరింత విలువైనవిగా మారుతాయి.
ఈ ఫలితం ఏమి చెబుతుంది, ఏమి చెప్పదు
AI పరిశ్రమకు వెంటనే తీసుకోవాల్సిన సందేశం ఏమిటంటే, తర్కశక్తి బెంచ్మార్క్లు ఇంకా చురుకైన పోటీ సరిహద్దుగానే ఉన్నాయి. గత రెండు సంవత్సరాలలో మోడల్ డెవలపర్లు చాట్ ఫ్లూయెన్సీని దాటి, అపరిచిత సెట్టింగుల్లో ఆలోచించి, అనుకూలించి, చర్య తీసుకోగల వ్యవస్థల వైపు కృషి చేస్తున్నారు. కొత్తదనాన్ని స్పష్టంగా లక్ష్యంగా పెట్టుకుని రూపొందించిన బెంచ్మార్క్పై ఇంత పెద్ద ఎగబాకింపు తప్పనిసరిగా పరిశోధనా ప్రాధాన్యతలు, మార్కెటింగ్ దావాలు, మరియు పెట్టుబడిదారుల కథనాలను ప్రభావితం చేస్తుంది.
కానీ ఒక బెంచ్మార్క్ రంగ స్థితిని తేల్చదు. ARC-AGI-3 ఒక అర్థవంతమైన సంకేతం, తుది తీర్పు కాదు. ఇది విశ్వసనీయత, భద్రత, నిజాయితీ, లేదా ఆర్థికపరంగా ముఖ్యమైన పనుల మొత్తం విస్తృతిలో పనితీరును నేరుగా కొలవదు. నిజమైన ఉత్పత్తి పరిమితుల కింద మోడల్ ఈ ప్రవర్తనలను ఎంత సమర్థంగా నిలుపుకుంటుందో కూడా ఇది చూపదు.
బెంచ్మార్క్ బృంద విశ్లేషణ నిలబడితే, ఈ ఫలితం అపరిచిత సమస్యలపై తర్కించగల మోడళ్లను నిర్మించే పోరు కొత్త దశలోకి ప్రవేశిస్తోందని చూపుతుంది. నెలల తరబడి ప్రజా చర్చ అతిశయోక్తి మరియు నిరాకరణ మధ్య ఊగిసలాడింది: AI సాధారణ సామర్థ్యానికి దగ్గరపడుతోంది, లేదా బెంచ్మార్క్ లాభాలు ఎక్కువగా పొగ మాత్రమే. ఇలాంటి ఫలితాలు రెండు వైపులనూ సంక్లిష్టం చేస్తాయి. ఇవి సాధారణ మేధస్సు వచ్చేసిందని నిరూపించవు, కానీ కనీసం కొన్ని వ్యవస్థలను కేవలం autocomplete గా తేలికగా కొట్టిపారేయడం కష్టమవుతోందని సూచిస్తాయి.
తదుపరి ప్రశ్న, ఈ సామర్థ్యాలు ఇతర సందర్భాలకు మారుతాయా అన్నదే. అవి మారితే, ఈ స్కోరు లీడర్బోర్డు అప్డేట్గా కాకుండా, తర్కశక్తి మెరుగుదలలు పరస్పరం కలిసిపోవడం ప్రారంభించాయనే ప్రాథమిక సంకేతంగా గుర్తుండిపోతుంది. లేకపోతే, AI డిప్లాయ్మెంట్ యొక్క మూల ఆర్థికశాస్త్రాన్ని మార్చకుండా వేడి మాత్రమే సృష్టించిన బెంచ్మార్క్ల దీర్ఘ జాబితాలో ఇది మరొకదిగా చేరుతుంది. ఇప్పటికి, ఈ ఫలితం ముఖ్యమైనది, ఎందుకంటే ఇది నిర్దిష్టం, కొలవదగినది, మరియు రంగంలోని మిగతా భాగం దీనికి సమాధానం చెప్పాల్సినంత పెద్దది.
This article is based on reporting by The Decoder. Read the original article.
Originally published on the-decoder.com


