Claude Opus 5, ARC-AGI-3-இல் பெரிய இடைவெளியைத் திறக்கிறது
The Decoder வெளியீட்டில் மேற்கோளிடப்பட்ட பெஞ்ச்மார்க் அமைப்பாளர்களின் படி, Anthropic-இன் Claude Opus 5 ARC-AGI-3-இல் 30.2 சதவீதம் என்ற அறிவிக்கப்பட்ட மதிப்பெண்ணுடன் முதலிடத்தைப் பிடித்துள்ளது. இது முந்தைய முன்னணி முடிவான 7.8 சதவீதத்திலிருந்து குறிப்பிடத்தக்க உயர்வாகும்; அந்த முந்தைய முடிவு OpenAI-இன் GPT-5.6 Sol (Max) என்பதற்கு சொந்தமானதாக அதே அறிக்கை குறிப்பிடுகிறது. பெஞ்ச்மார்க் முன்னேற்றங்கள் பெரும்பாலும் சிறு சிறு படிகளாகவோ அல்லது சர்ச்சைக்குரியதாகவோ இருக்கும் துறையில்கூட, இந்த இடைவெளியின் அளவு தெளிவாகத் தெரிகிறது.
இந்த முடிவு முக்கியமானது, ஏனெனில் ARC-AGI-3 என்பது சேமிக்கப்பட்ட உண்மைகள் பற்றிய சோதனை அல்ல; மாறாக, ஒரு மாதிரி இதற்கு முன் பார்க்காத புதிய சிக்கல்களை எவ்வாறு சமாளிக்கிறது என்பதை சோதிக்கும் அமைப்பு. ARC Prize விவரித்த அமைப்பில், மாதிரி தொடர்பாடல் சூழல்களில் வைக்கப்படுகிறது, விதிகளை ஊகிக்க வேண்டும், செயல்களைத் திட்டமிட வேண்டும், மற்றும் அவற்றை படிப்படியாக நிறைவேற்ற வேண்டும். எனவே, நினைவிலுள்ள அறிவை விட புதுமையின் கீழ் காரணமிடும் திறனை அளக்கும் சிக்னலாக இந்த பெஞ்ச்மார்க் பயன்படுகிறது, இருந்தாலும் இது பல அளவீடுகளில் ஒன்றாகவே உள்ளது.
பெஞ்ச்மார்க் செயல்திறன் மட்டும் பொதுப் புத்திசாலித்தனத்தின் கேள்வியை ஒருபோதும் முடிவுறச் செய்யாது; மதிப்பெண்கள் வடிவமைப்பு, மதிப்பீடு, மற்றும் ப்ராம்ப்டிங் ஆகியவற்றின் தனித்துவங்களையும் பிரதிபலிக்கலாம். ஆனால் சமீபத்திய முடிவு முக்கியமானது, ஏனெனில் பெஞ்ச்மார்க் குழுவே லீடர்போர்டில் உள்ள இறுதி எண்ணிக்கையை மட்டும் அல்ல, மாதிரி காரணமிடும் விதத்தில் உள்ள வேறுபாடுகளைச் சுட்டிக்காட்டுகிறது.
முடிவு ஏன் வேறுபட்டது என்று ARC Prize கூறுகிறது
கொடுக்கப்பட்ட மூல உரையின் படி, Opus 5-இன் முன்னிலையை ARC Prize வலுவான தர்க்க ரீதியான காரணமிடலுக்கு சொந்தமானதாகக் கூறுகிறது; அது அறியாத சூழல்களில் அதிக சுயாதீனமான ஆய்வு, திட்டமிடல், மற்றும் நிறைவேற்றலை ஆதரிக்கிறது. இது முக்கியமான வேறுபாடு. சமீபத்திய பல AI முன்னேற்றங்கள் அளவு, கருவி பயன்பாடு, மீட்டெடுப்பு, அல்லது ஒரு மாதிரியைச் சுற்றி நுட்பமாக வடிவமைக்கப்பட்ட அமைப்புகளிலிருந்து வந்துள்ளன. இங்கே அதிகாரப்பூர்வ மதிப்பெண்கள் மொழி மாதிரியின் சொந்த செயல்திறனை மட்டுமே கணக்கில் எடுத்துக்கொள்கின்றன; பிற இடங்களில் முடிவுகளை உயர்த்தக்கூடிய கூடுதல் மென்பொருள் harnesses-ஐ விலக்குகின்றன என்று ARC Prize கூறுகிறது.
அந்த எச்சரிக்கை இந்த பெஞ்ச்மார்க் ஏன் தொடர்ந்து கவனம் ஈர்க்கிறது என்பதை விளக்குகிறது. அடிப்படையான கேள்வி, scaffolding உடன் கடின பணிகளை ஒரு மாதிரியைச் செய்து முடிக்கச் செய்ய முடியுமா என்பது அல்ல; புதிய சூழலில் இறக்கிவிட்டபோது அது எவ்வளவு தன்னிச்சையாக செயல்பட முடிகிறது என்பதே. மதிப்பெண் உயர்வு உண்மையான சுய-நடத்தல் சிக்கல் தீர்வின் உயர்வை பிரதிபலித்தால், அது வெறும் அலங்கார மேம்பாடு அல்ல, திறனில் அர்த்தமுள்ள மாற்றத்தைக் குறிக்கும்.
அறிக்கையில் மேலும் கூறப்படுவதாவது, Opus 5 முன்பு தீர்க்கப்படாத ஐந்து சூழல்களைத் தீர்த்துள்ளது; அவற்றில் நான்கு மனித நிலை அல்லது அதற்கு மேல் இருந்தன. மனிதர்கள் விரைவாக புரிந்துகொள்ளக்கூடிய பணிகளை மையமாகக் கொண்ட ஒரு பெஞ்ச்மார்க்கில் இத்தகைய முன்னேற்றம் குறிப்பிடத்தக்கது. இது சராசரி செயல்திறன் மட்டும் மேம்பட்டதல்ல, முந்தைய அமைப்புகளுக்கு கடுமையான தடையாக இருந்த சிக்கல்களையும் கடந்து செல்லும் திறனையும் குறிக்கிறது.
சோதனையின் போது காணப்பட்ட அசாதாரண நடத்தை
மூலப் பொருளில் மிகவும் கவனத்தை ஈர்க்கும் விவரம் தலைப்பு மதிப்பெண் அல்ல; பணிகளைத் தீர்க்கும் போது Opus 5 எப்படி நடந்துகொண்டது என்பதற்கான விளக்கமே. ARC Prize ஆய்வாளர்கள், மாதிரி பணிகளை அல்ஜீப்ரா குறியீடாக மாற்றி, தானாகவே reflection equations-ஐ உருவாக்கியதாகக் கூறப்படுகிறது; இந்த பெஞ்ச்மார்க்கில் இதுபோன்ற நடத்தை கொண்ட மாதிரி ஒன்றை இதற்கு முன் காணவில்லை என்று அவர்கள் தெரிவித்தனர்.
இதனால் அமைப்பு மனித அர்த்தத்தில் கணிதத்தைப் புரிந்துகொண்டது என்று அர்த்தமில்லை, அல்லது இயந்திர அறிவுசார் செயல்பாட்டிற்கான புதிய கோட்பாடு நிரூபிக்கப்படுகிறது என்றும் இல்லை. ஆனால் ஒரு புதிரின் மேற்பரப்பு வடிவத்தில் வெறும் pattern matching செய்வதைவிட, மிகவும் நெகிழ்வான உள்நடவடிக்கை மூலோபாயத்தை இது சுட்டிக்காட்டுகிறது. நடைமுறை விளைவு என்னவெனில், நேரடி அணுகுமுறைகள் தோல்வியடைந்தால், ஒரு மாதிரி தானாகவே இடைநிலை பிரதிநிதிகளை உருவாக்கத் தொடங்கலாம்.
அந்த திறன் பெஞ்ச்மார்க் கலாச்சாரத்தை விட மிகவும் விரிவான தாக்கத்தை ஏற்படுத்தும். நிஜ உலகச் சூழல்களில், பயனுள்ள AI அமைப்புகள் பலமுறை தெளிவில்லாத சிக்கல்களை மறுவடிவமைக்க, அவற்றை சிறிய படிகளாகப் பிரிக்க, மற்றும் பதிலை அடைவதற்கு முன் பல சாத்தியமான மூலோபாயங்களைச் சோதிக்க வேண்டும். முக்கியமாக சேமிக்கப்பட்ட தொடர்புகளின் மீது மட்டுமே சார்ந்திருக்கும் மாதிரியைவிட, தன்னிச்சையாக அப்ஸ்ட்ராக்ஷன்களை உருவாக்கக்கூடிய மாதிரி மென்பொருள் பணிகள், அறிவியல் உதவி, ரோபோட்டிக்ஸ் திட்டமிடல், மற்றும் செயல்பாட்டு முடிவு ஆதரவு ஆகியவற்றுக்கு சிறப்பாக பொருந்தலாம்.

அதற்கிடையில், எச்சரிக்கை தேவை. சில கண் கவரும் எடுத்துக்காட்டுகள் ஒரு மாதிரியின் நடத்தையை அது உண்மையில் இருப்பதைவிட அதிக ஒருங்கிணைந்ததாகவோ அல்லது பொது தன்மை கொண்டதாகவோ காட்டக்கூடும். அடுத்ததாக முக்கியமானது, அதே போக்குகள் விரிவான மதிப்பீடுகளிலும், குறைவாகக் கட்டுப்படுத்தப்பட்ட deployment சூழல்களிலும் தொடர்ந்து தோன்றுகிறதா என்பதே.
விரிவான லீடர்போர்டு படம்
கொடுக்கப்பட்ட உரையில் Opus 5, ARC-AGI-3-இல் GPT-5.6 Sol (Max)-ஐ மட்டுமல்ல, ARC Prize சுமார் 20 சதவீதம் மதிப்பெண் அளிக்கும் Anthropic-இன் சொந்த Fable-class அமைப்புகளையும் மிஞ்சுகிறது என்று கூறப்படுகிறது. இந்த உள்கட்டுத்தர ஒப்பீடு வெளிப்புற ஒப்பீட்டைப் போலவே முக்கியமானதாக இருக்கலாம். இது இந்த முன்னேற்றம் நிறுவனங்களுக்கு இடையேயான ஒரே தடவை ரேங்க் மாற்றம் அல்ல, Anthropic-இன் சொந்த மாதிரி வரிசையில் செயல்திறன் உயர்வின் பரந்த ஓட்டத்தின் ஒரு பகுதி என்பதைச் சொல்கிறது.
பெஞ்ச்மார்க்கின் பழைய பதிப்புகளில், Opus 5 ARC-AGI-2-இல் 90.4 சதவீதமும் ARC-AGI-1-இல் 97.5 சதவீதமும் அடைகிறது என்று மூல உரை கூறுகிறது; இது முந்தைய உச்ச மதிப்பெண்களைப் பொருந்தினாலும், செலவு சற்றே அதிகம். அந்த விவரம் கதையை சிக்கலாக்குகிறது. புதிய பெஞ்ச்மார்க் மாதிரிகளை அதிக தெளிவாகப் பிரிக்கிறது போலத் தெரிகிறது; முந்தைய பதிப்புகள் மேல்தளத்தில் ஏற்கனவே நிறைவு நிலைக்கு அருகில் இருந்திருக்கலாம். வேறு வார்த்தைகளில், ARC-AGI-3 அதிக பயனுள்ளதாக இருக்கலாம், ஏனெனில் இது இன்னும் மிக உயர்திறன் கொண்ட அமைப்புகளுக்கு இடையில் வேறுபாட்டை காட்ட இடமளிக்கிறது.
அறிக்கையில் மேலும் கூறப்படுவதாவது, 25 பொது டெமோ சூழல்களில் ஆறு இப்போது தீர்க்கப்பட்டுள்ளன, மேலும் முழு முடிவுகள், replay-கள், மற்றும் benchmarking code பொது பயன்பாட்டிற்கு கிடைக்கின்றன. அந்த வெளிப்படைத்தன்மை முக்கியமானது. இறுதி லீடர்போர்டை மட்டுமல்ல, எடுத்துக்காட்டுகள், replay trace-கள், மற்றும் மதிப்பீட்டு முறையையும் வெளி ஆராய்ச்சியாளர்கள் ஆய்வு செய்ய முடிந்தால் மட்டுமே பெஞ்ச்மார்க் கூற்றுகளுக்கு அதிக மதிப்பு கிடைக்கும்.
இந்த முடிவு என்ன சொல்கிறது, என்ன சொல்லவில்லை
AI துறைக்கான உடனடி takeaway என்னவென்றால், காரணமிடல் பெஞ்ச்மார்க்குகள் இன்னும் செயலில் இருக்கும் போட்டித் தளம். கடந்த இரண்டு ஆண்டுகளாக, மாதிரி உருவாக்குநர்கள் chat fluency-யைத் தாண்டி, அறியாத சூழல்களில் ஆலோசித்து, ஏற்பெடுத்து, செயல்படக்கூடிய அமைப்புகளுக்குத் தள்ளி வந்துள்ளனர். புதிய தன்மையை மையமாகக் கொண்டு வெளிப்படையாக உருவாக்கப்பட்ட பெஞ்ச்மார்க்கில் இவ்வளவு பெரிய தாவல், ஆராய்ச்சி முன்னுரிமைகள், சந்தைப்படுத்தல் கூற்றுகள், மற்றும் முதலீட்டாளர் கதைகளை தவிர்க்க முடியாமல் வடிவமைக்கும்.
ஆனால் ஒரு பெஞ்ச்மார்க் துறையின் நிலையை நிர்ணயிக்காது. ARC-AGI-3 ஒரு அர்த்தமுள்ள சிக்னல், இறுதி தீர்ப்பு அல்ல. இது நம்பகத்தன்மை, பாதுகாப்பு, உண்மைத்தன்மை, அல்லது பொருளாதார ரீதியாக முக்கியமான பணிகளின் முழு பரப்பில் செயல்திறனை நேரடியாக அளவிடவில்லை. நிஜ உற்பத்தி கட்டுப்பாடுகளின் கீழ் இந்த நடத்தைகளை ஒரு மாதிரி எவ்வளவு திறமையாகத் தொடர முடியும் என்பதையும் இது காட்டவில்லை.
பெஞ்ச்மார்க் குழுவின் பகுப்பாய்வு உறுதி செய்யப்பட்டால், இது அறியாத பிரச்சினைகளில் காரணமிடக்கூடிய மாதிரிகளை உருவாக்கும் போட்டி ஒரு புதிய கட்டத்திற்குள் நுழைகிறது என்பதைக் காட்டுகிறது. பல மாதங்களாக பொது விவாதம் மிகைப்படுத்தலும் அலட்சியப்படுத்தலும் இடையே அலைந்தது: AI பொதுமைப்படுத்தப்பட்ட திறமைக்கு நெருக்கமாக இருக்கிறது, அல்லது பெஞ்ச்மார்க் முன்னேற்றங்கள் பெரும்பாலும் புகைமட்டுமே. இப்படியான முடிவுகள் இரு நிலைப்பாடுகளையும் சிக்கலாக்குகின்றன. இவை பொதுப் புத்திசாலித்தனம் வந்துவிட்டது என்று நிரூபிக்கவில்லை; ஆனால் குறைந்தபட்சம் சில அமைப்புகளை வெறும் autocomplete என்று தள்ளிவிடுவது கடினமாகிவருகிறது என்பதைத் தெளிவாகச் சொல்கின்றன.
அடுத்த கேள்வி, அந்த திறன்கள் பிற சூழல்களுக்கு மாறுமா என்பதே. அவை மாறினால், இந்த மதிப்பெண் லீடர்போர்டு அப்டேட்டாக அல்ல, காரணமிடல் மேம்பாடுகள் ஒன்றின் மீது ஒன்று சேரத் தொடங்கியதற்கான ஆரம்ப அறிகுறியாக நினைவில் நிற்கும். மாறாவிட்டால், அது AI deployment-இன் அடிப்படை பொருளாதாரத்தை மாற்றாமல் வெப்பத்தை மட்டும் உருவாக்கிய பெஞ்ச்மார்க்குகளின் நீண்ட பட்டியலில் இன்னொன்றாக சேரும். இப்போது இந்த முடிவு முக்கியமானது, ஏனெனில் அது குறிப்பிட்டது, அளவிடக்கூடியது, மேலும் துறையின் மீதமுள்ள பகுதி அதற்கு பதிலளிக்க வேண்டிய அளவு பெரியது.
This article is based on reporting by The Decoder. Read the original article.
Originally published on the-decoder.com


