Claude Opus 5, ARC-AGI-3-இல் பெரிய இடைவெளியைத் திறக்கிறது

The Decoder வெளியீட்டில் மேற்கோளிடப்பட்ட பெஞ்ச்மார்க் அமைப்பாளர்களின் படி, Anthropic-இன் Claude Opus 5 ARC-AGI-3-இல் 30.2 சதவீதம் என்ற அறிவிக்கப்பட்ட மதிப்பெண்ணுடன் முதலிடத்தைப் பிடித்துள்ளது. இது முந்தைய முன்னணி முடிவான 7.8 சதவீதத்திலிருந்து குறிப்பிடத்தக்க உயர்வாகும்; அந்த முந்தைய முடிவு OpenAI-இன் GPT-5.6 Sol (Max) என்பதற்கு சொந்தமானதாக அதே அறிக்கை குறிப்பிடுகிறது. பெஞ்ச்மார்க் முன்னேற்றங்கள் பெரும்பாலும் சிறு சிறு படிகளாகவோ அல்லது சர்ச்சைக்குரியதாகவோ இருக்கும் துறையில்கூட, இந்த இடைவெளியின் அளவு தெளிவாகத் தெரிகிறது.

இந்த முடிவு முக்கியமானது, ஏனெனில் ARC-AGI-3 என்பது சேமிக்கப்பட்ட உண்மைகள் பற்றிய சோதனை அல்ல; மாறாக, ஒரு மாதிரி இதற்கு முன் பார்க்காத புதிய சிக்கல்களை எவ்வாறு சமாளிக்கிறது என்பதை சோதிக்கும் அமைப்பு. ARC Prize விவரித்த அமைப்பில், மாதிரி தொடர்பாடல் சூழல்களில் வைக்கப்படுகிறது, விதிகளை ஊகிக்க வேண்டும், செயல்களைத் திட்டமிட வேண்டும், மற்றும் அவற்றை படிப்படியாக நிறைவேற்ற வேண்டும். எனவே, நினைவிலுள்ள அறிவை விட புதுமையின் கீழ் காரணமிடும் திறனை அளக்கும் சிக்னலாக இந்த பெஞ்ச்மார்க் பயன்படுகிறது, இருந்தாலும் இது பல அளவீடுகளில் ஒன்றாகவே உள்ளது.

பெஞ்ச்மார்க் செயல்திறன் மட்டும் பொதுப் புத்திசாலித்தனத்தின் கேள்வியை ஒருபோதும் முடிவுறச் செய்யாது; மதிப்பெண்கள் வடிவமைப்பு, மதிப்பீடு, மற்றும் ப்ராம்ப்டிங் ஆகியவற்றின் தனித்துவங்களையும் பிரதிபலிக்கலாம். ஆனால் சமீபத்திய முடிவு முக்கியமானது, ஏனெனில் பெஞ்ச்மார்க் குழுவே லீடர்போர்டில் உள்ள இறுதி எண்ணிக்கையை மட்டும் அல்ல, மாதிரி காரணமிடும் விதத்தில் உள்ள வேறுபாடுகளைச் சுட்டிக்காட்டுகிறது.

முடிவு ஏன் வேறுபட்டது என்று ARC Prize கூறுகிறது

கொடுக்கப்பட்ட மூல உரையின் படி, Opus 5-இன் முன்னிலையை ARC Prize வலுவான தர்க்க ரீதியான காரணமிடலுக்கு சொந்தமானதாகக் கூறுகிறது; அது அறியாத சூழல்களில் அதிக சுயாதீனமான ஆய்வு, திட்டமிடல், மற்றும் நிறைவேற்றலை ஆதரிக்கிறது. இது முக்கியமான வேறுபாடு. சமீபத்திய பல AI முன்னேற்றங்கள் அளவு, கருவி பயன்பாடு, மீட்டெடுப்பு, அல்லது ஒரு மாதிரியைச் சுற்றி நுட்பமாக வடிவமைக்கப்பட்ட அமைப்புகளிலிருந்து வந்துள்ளன. இங்கே அதிகாரப்பூர்வ மதிப்பெண்கள் மொழி மாதிரியின் சொந்த செயல்திறனை மட்டுமே கணக்கில் எடுத்துக்கொள்கின்றன; பிற இடங்களில் முடிவுகளை உயர்த்தக்கூடிய கூடுதல் மென்பொருள் harnesses-ஐ விலக்குகின்றன என்று ARC Prize கூறுகிறது.

அந்த எச்சரிக்கை இந்த பெஞ்ச்மார்க் ஏன் தொடர்ந்து கவனம் ஈர்க்கிறது என்பதை விளக்குகிறது. அடிப்படையான கேள்வி, scaffolding உடன் கடின பணிகளை ஒரு மாதிரியைச் செய்து முடிக்கச் செய்ய முடியுமா என்பது அல்ல; புதிய சூழலில் இறக்கிவிட்டபோது அது எவ்வளவு தன்னிச்சையாக செயல்பட முடிகிறது என்பதே. மதிப்பெண் உயர்வு உண்மையான சுய-நடத்தல் சிக்கல் தீர்வின் உயர்வை பிரதிபலித்தால், அது வெறும் அலங்கார மேம்பாடு அல்ல, திறனில் அர்த்தமுள்ள மாற்றத்தைக் குறிக்கும்.

அறிக்கையில் மேலும் கூறப்படுவதாவது, Opus 5 முன்பு தீர்க்கப்படாத ஐந்து சூழல்களைத் தீர்த்துள்ளது; அவற்றில் நான்கு மனித நிலை அல்லது அதற்கு மேல் இருந்தன. மனிதர்கள் விரைவாக புரிந்துகொள்ளக்கூடிய பணிகளை மையமாகக் கொண்ட ஒரு பெஞ்ச்மார்க்கில் இத்தகைய முன்னேற்றம் குறிப்பிடத்தக்கது. இது சராசரி செயல்திறன் மட்டும் மேம்பட்டதல்ல, முந்தைய அமைப்புகளுக்கு கடுமையான தடையாக இருந்த சிக்கல்களையும் கடந்து செல்லும் திறனையும் குறிக்கிறது.

சோதனையின் போது காணப்பட்ட அசாதாரண நடத்தை

மூலப் பொருளில் மிகவும் கவனத்தை ஈர்க்கும் விவரம் தலைப்பு மதிப்பெண் அல்ல; பணிகளைத் தீர்க்கும் போது Opus 5 எப்படி நடந்துகொண்டது என்பதற்கான விளக்கமே. ARC Prize ஆய்வாளர்கள், மாதிரி பணிகளை அல்ஜீப்ரா குறியீடாக மாற்றி, தானாகவே reflection equations-ஐ உருவாக்கியதாகக் கூறப்படுகிறது; இந்த பெஞ்ச்மார்க்கில் இதுபோன்ற நடத்தை கொண்ட மாதிரி ஒன்றை இதற்கு முன் காணவில்லை என்று அவர்கள் தெரிவித்தனர்.

இதனால் அமைப்பு மனித அர்த்தத்தில் கணிதத்தைப் புரிந்துகொண்டது என்று அர்த்தமில்லை, அல்லது இயந்திர அறிவுசார் செயல்பாட்டிற்கான புதிய கோட்பாடு நிரூபிக்கப்படுகிறது என்றும் இல்லை. ஆனால் ஒரு புதிரின் மேற்பரப்பு வடிவத்தில் வெறும் pattern matching செய்வதைவிட, மிகவும் நெகிழ்வான உள்நடவடிக்கை மூலோபாயத்தை இது சுட்டிக்காட்டுகிறது. நடைமுறை விளைவு என்னவெனில், நேரடி அணுகுமுறைகள் தோல்வியடைந்தால், ஒரு மாதிரி தானாகவே இடைநிலை பிரதிநிதிகளை உருவாக்கத் தொடங்கலாம்.

அந்த திறன் பெஞ்ச்மார்க் கலாச்சாரத்தை விட மிகவும் விரிவான தாக்கத்தை ஏற்படுத்தும். நிஜ உலகச் சூழல்களில், பயனுள்ள AI அமைப்புகள் பலமுறை தெளிவில்லாத சிக்கல்களை மறுவடிவமைக்க, அவற்றை சிறிய படிகளாகப் பிரிக்க, மற்றும் பதிலை அடைவதற்கு முன் பல சாத்தியமான மூலோபாயங்களைச் சோதிக்க வேண்டும். முக்கியமாக சேமிக்கப்பட்ட தொடர்புகளின் மீது மட்டுமே சார்ந்திருக்கும் மாதிரியைவிட, தன்னிச்சையாக அப்ஸ்ட்ராக்ஷன்களை உருவாக்கக்கூடிய மாதிரி மென்பொருள் பணிகள், அறிவியல் உதவி, ரோபோட்டிக்ஸ் திட்டமிடல், மற்றும் செயல்பாட்டு முடிவு ஆதரவு ஆகியவற்றுக்கு சிறப்பாக பொருந்தலாம்.

Claude Opus 5 leads the ARC-AGI-3 leaderboard by a wide margin, far ahead of GPT-5.6 Sol (Max) and other competitors. | Image: ARC Prize
Claude Opus 5 leads the ARC-AGI-3 leaderboard by a wide margin, far ahead of GPT-5.6 Sol (Max) and other competitors. | Image: ARC Prize

அதற்கிடையில், எச்சரிக்கை தேவை. சில கண் கவரும் எடுத்துக்காட்டுகள் ஒரு மாதிரியின் நடத்தையை அது உண்மையில் இருப்பதைவிட அதிக ஒருங்கிணைந்ததாகவோ அல்லது பொது தன்மை கொண்டதாகவோ காட்டக்கூடும். அடுத்ததாக முக்கியமானது, அதே போக்குகள் விரிவான மதிப்பீடுகளிலும், குறைவாகக் கட்டுப்படுத்தப்பட்ட deployment சூழல்களிலும் தொடர்ந்து தோன்றுகிறதா என்பதே.

விரிவான லீடர்போர்டு படம்

கொடுக்கப்பட்ட உரையில் Opus 5, ARC-AGI-3-இல் GPT-5.6 Sol (Max)-ஐ மட்டுமல்ல, ARC Prize சுமார் 20 சதவீதம் மதிப்பெண் அளிக்கும் Anthropic-இன் சொந்த Fable-class அமைப்புகளையும் மிஞ்சுகிறது என்று கூறப்படுகிறது. இந்த உள்கட்டுத்தர ஒப்பீடு வெளிப்புற ஒப்பீட்டைப் போலவே முக்கியமானதாக இருக்கலாம். இது இந்த முன்னேற்றம் நிறுவனங்களுக்கு இடையேயான ஒரே தடவை ரேங்க் மாற்றம் அல்ல, Anthropic-இன் சொந்த மாதிரி வரிசையில் செயல்திறன் உயர்வின் பரந்த ஓட்டத்தின் ஒரு பகுதி என்பதைச் சொல்கிறது.

பெஞ்ச்மார்க்கின் பழைய பதிப்புகளில், Opus 5 ARC-AGI-2-இல் 90.4 சதவீதமும் ARC-AGI-1-இல் 97.5 சதவீதமும் அடைகிறது என்று மூல உரை கூறுகிறது; இது முந்தைய உச்ச மதிப்பெண்களைப் பொருந்தினாலும், செலவு சற்றே அதிகம். அந்த விவரம் கதையை சிக்கலாக்குகிறது. புதிய பெஞ்ச்மார்க் மாதிரிகளை அதிக தெளிவாகப் பிரிக்கிறது போலத் தெரிகிறது; முந்தைய பதிப்புகள் மேல்தளத்தில் ஏற்கனவே நிறைவு நிலைக்கு அருகில் இருந்திருக்கலாம். வேறு வார்த்தைகளில், ARC-AGI-3 அதிக பயனுள்ளதாக இருக்கலாம், ஏனெனில் இது இன்னும் மிக உயர்திறன் கொண்ட அமைப்புகளுக்கு இடையில் வேறுபாட்டை காட்ட இடமளிக்கிறது.

அறிக்கையில் மேலும் கூறப்படுவதாவது, 25 பொது டெமோ சூழல்களில் ஆறு இப்போது தீர்க்கப்பட்டுள்ளன, மேலும் முழு முடிவுகள், replay-கள், மற்றும் benchmarking code பொது பயன்பாட்டிற்கு கிடைக்கின்றன. அந்த வெளிப்படைத்தன்மை முக்கியமானது. இறுதி லீடர்போர்டை மட்டுமல்ல, எடுத்துக்காட்டுகள், replay trace-கள், மற்றும் மதிப்பீட்டு முறையையும் வெளி ஆராய்ச்சியாளர்கள் ஆய்வு செய்ய முடிந்தால் மட்டுமே பெஞ்ச்மார்க் கூற்றுகளுக்கு அதிக மதிப்பு கிடைக்கும்.

இந்த முடிவு என்ன சொல்கிறது, என்ன சொல்லவில்லை

AI துறைக்கான உடனடி takeaway என்னவென்றால், காரணமிடல் பெஞ்ச்மார்க்குகள் இன்னும் செயலில் இருக்கும் போட்டித் தளம். கடந்த இரண்டு ஆண்டுகளாக, மாதிரி உருவாக்குநர்கள் chat fluency-யைத் தாண்டி, அறியாத சூழல்களில் ஆலோசித்து, ஏற்பெடுத்து, செயல்படக்கூடிய அமைப்புகளுக்குத் தள்ளி வந்துள்ளனர். புதிய தன்மையை மையமாகக் கொண்டு வெளிப்படையாக உருவாக்கப்பட்ட பெஞ்ச்மார்க்கில் இவ்வளவு பெரிய தாவல், ஆராய்ச்சி முன்னுரிமைகள், சந்தைப்படுத்தல் கூற்றுகள், மற்றும் முதலீட்டாளர் கதைகளை தவிர்க்க முடியாமல் வடிவமைக்கும்.

ஆனால் ஒரு பெஞ்ச்மார்க் துறையின் நிலையை நிர்ணயிக்காது. ARC-AGI-3 ஒரு அர்த்தமுள்ள சிக்னல், இறுதி தீர்ப்பு அல்ல. இது நம்பகத்தன்மை, பாதுகாப்பு, உண்மைத்தன்மை, அல்லது பொருளாதார ரீதியாக முக்கியமான பணிகளின் முழு பரப்பில் செயல்திறனை நேரடியாக அளவிடவில்லை. நிஜ உற்பத்தி கட்டுப்பாடுகளின் கீழ் இந்த நடத்தைகளை ஒரு மாதிரி எவ்வளவு திறமையாகத் தொடர முடியும் என்பதையும் இது காட்டவில்லை.

பெஞ்ச்மார்க் குழுவின் பகுப்பாய்வு உறுதி செய்யப்பட்டால், இது அறியாத பிரச்சினைகளில் காரணமிடக்கூடிய மாதிரிகளை உருவாக்கும் போட்டி ஒரு புதிய கட்டத்திற்குள் நுழைகிறது என்பதைக் காட்டுகிறது. பல மாதங்களாக பொது விவாதம் மிகைப்படுத்தலும் அலட்சியப்படுத்தலும் இடையே அலைந்தது: AI பொதுமைப்படுத்தப்பட்ட திறமைக்கு நெருக்கமாக இருக்கிறது, அல்லது பெஞ்ச்மார்க் முன்னேற்றங்கள் பெரும்பாலும் புகைமட்டுமே. இப்படியான முடிவுகள் இரு நிலைப்பாடுகளையும் சிக்கலாக்குகின்றன. இவை பொதுப் புத்திசாலித்தனம் வந்துவிட்டது என்று நிரூபிக்கவில்லை; ஆனால் குறைந்தபட்சம் சில அமைப்புகளை வெறும் autocomplete என்று தள்ளிவிடுவது கடினமாகிவருகிறது என்பதைத் தெளிவாகச் சொல்கின்றன.

அடுத்த கேள்வி, அந்த திறன்கள் பிற சூழல்களுக்கு மாறுமா என்பதே. அவை மாறினால், இந்த மதிப்பெண் லீடர்போர்டு அப்டேட்டாக அல்ல, காரணமிடல் மேம்பாடுகள் ஒன்றின் மீது ஒன்று சேரத் தொடங்கியதற்கான ஆரம்ப அறிகுறியாக நினைவில் நிற்கும். மாறாவிட்டால், அது AI deployment-இன் அடிப்படை பொருளாதாரத்தை மாற்றாமல் வெப்பத்தை மட்டும் உருவாக்கிய பெஞ்ச்மார்க்குகளின் நீண்ட பட்டியலில் இன்னொன்றாக சேரும். இப்போது இந்த முடிவு முக்கியமானது, ஏனெனில் அது குறிப்பிட்டது, அளவிடக்கூடியது, மேலும் துறையின் மீதமுள்ள பகுதி அதற்கு பதிலளிக்க வேண்டிய அளவு பெரியது.

This article is based on reporting by The Decoder. Read the original article.

Originally published on the-decoder.com