OpenAI, ARC-AGI-3 முன்னணியை மீட்டதாக கூறுகிறது, ஆனால் இந்த பெஞ்ச்மார்க் விவாதம் உண்மையில் கருவிகளைப் பற்றியது

OpenAI தனது GPT-5.6 Sol மாடல் ARC-AGI-3-ல் 38.3% பெற்றதாக கூறுகிறது; அதே பெஞ்ச்மார்க்-இல் Anthropic-இன் Claude Opus 5 பெற்ற 30.2%-ஐ விட இது உயர்ந்த மதிப்பெண். காகிதத்தில் பார்த்தால், இது அப்ஸ்ட்ராக்ட் ரீசனிங் குறித்த கவனமாகப் பார்க்கப்படும் போட்டியில் நேரடியான பின்னடைவு மாற்றம் போல தோன்றுகிறது. நடைமுறையில், இந்தக் கோரிக்கை இன்னும் சிக்கலானது. இந்த உயர்ந்த முடிவு GPT-5.6 Sol-ஐ OpenAI-இன் சொந்த Responses API மற்றும் பெஞ்ச்மார்க்கின் தரநிலை சோதனை ஹார்னஸில் இல்லாத இரண்டு குறிப்பிட்ட அமைப்புகளுடன் இயக்குவதில்தான் சார்ந்துள்ளது.

இந்த வேறுபாடு முக்கியமானது, ஏனெனில் ARC-AGI-3, ஒரு மாடல் அறிமுகமற்ற தர்க்கச் சிக்கல்களை எவ்வளவு நன்றாக கையாளுகிறது என்பதை அளவிடுவதற்காக வடிவமைக்கப்பட்டுள்ளது; ஒரு விற்பனையாளர் தனது மாடலை தயாரிப்பு-சார்ந்த உட்கட்டமைப்பில் எவ்வளவு நன்றாக மூடிக்கொள்கிறார் என்பதை அல்ல. வழங்கப்பட்ட மூல உரையின் படி, GPT-5.6 Sol அதிகாரப்பூர்வ ஹார்னஸில் வெறும் 7.8% மட்டுமே பெற்றது; அந்த அமைப்பில் ஒவ்வொரு செயலும் முடிந்த பிறகு மாடலின் reasoning கைவிடப்படுகிறது. OpenAI-இன் மிக உயர்ந்த மதிப்பெண் “Retained Reasoning” மூலம் வந்தது, இது படிகளுக்கிடையில் மாடலின் chain of thought-ஐ பாதுகாக்கிறது, மற்றும் “Compaction” மூலம் வந்தது, இது பழைய context-ஐ நீக்குவதற்குப் பதிலாக சுருக்குகிறது.

இந்த முடிவு ஒரே leaderboard புதுப்பிப்பை விட ஆழமான விவாதத்தை உருவாக்குகிறது. AI evaluation-இல் இப்போது மையக் கேள்வியாக மாறியதை இது எழுப்புகிறது: memory handling, context management, மற்றும் API design மூலம் systems மேம்படும் போது, model capability-க்கும் product scaffolding-க்கும் இடையிலான எல்லையை எங்கே வரையறுக்க வேண்டும்?

ARC-AGI-3 ஏன் இவ்வளவு பெரிய மோதல் புள்ளியாக மாறியுள்ளது

ARC-வகை பெஞ்ச்மார்க்குகள் AI துறையில் அசாதாரண இடத்தைப் பெற்றுள்ளன, ஏனெனில் அவை memorization-ஐ விட generalization-ஐ சோதிக்க முயல்கின்றன. இந்த tasks, ஒரு system விதிகளை ஊகித்து புதிய puzzles-ஐத் தீர்க்க முடியுமா என்பதைப் பரிசோதிக்க உருவாக்கப்பட்டவை; அதனால் பரந்த reasoning முன்னேற்றத்திற்கான ஆதாரங்களைத் தேடும் ஆராய்ச்சியாளர்களுக்கும் விற்பனையாளர்களுக்கும் அவை மிகுந்த ஈர்ப்பை அளிக்கின்றன. அதனால்தான் setup குறித்த முரண்பாடுகள் மிக உணர்திறனாக மாறுகின்றன. model performance-ஐ தனிமைப்படுத்த உருவாக்கப்பட்ட benchmark, ஒருவழி வழங்குநரின் முடிவு standard environment-க்கு வெளியேயுள்ள அம்சங்களைச் சார்ந்தால், அதை விளக்குவது கடினமாகிறது.

மூல உரையில் விவரிக்கப்பட்ட OpenAI-இன் வாதம், பெஞ்ச்மார்க்குகள் model-ஐ மட்டும் அளவிடுவதில்லை என்பதாகும். அவை அதனைச் சூழ்ந்துள்ள தொழில்நுட்ப அமைப்பையும் அளவிடுகின்றன. இந்த நிலை பரந்த தொழில்துறை உண்மையை பிரதிபலிக்கிறது. நடைமுறைப்படுத்தப்பட்ட products-இல், models அரிதாகவே தனியாக இயங்குகின்றன. அவை orchestration layers, context windows, retrieval systems, tool use, மற்றும் state management-ஐ சார்ந்துள்ளன. ஒரு பெஞ்ச்மார்க் இந்த கூறுகளை புறக்கணித்தால், விற்பனையாளர்கள் அது உண்மையான உலக செயல்திறனை குறைத்து மதிப்பிடுகிறது என்று நியாயமாகக் கூறலாம்.

ஆனால் ARC-AGI-3, ஒவ்வொரு உண்மையான உலக deployment தேர்வையும் பிரதிபலிக்க வடிவமைக்கப்படவில்லை. வழங்குநர்களுக்கு இடையிலான ஒப்பீடுகள் பொருளுள்ளவையாக இருக்க, சூழலை போதுமான அளவு தரநிலைப்படுத்துவதற்காக அது வடிவமைக்கப்பட்டது. அதனால்தான் official benchmark harness உரையாடலில் மிகவும் முக்கியமானது. OpenAI அந்த ஹார்னஸுக்கு வெளியே குறிப்பிடத்தகுந்த அளவில் உயர்ந்த score-ஐ வெளியிடும்போது, அது ஒரு அதிக திறன் கொண்ட product stack-ஐ காட்டக்கூடும்; ஆனால் அது benchmark-இன் ஆரம்ப விதிகளின் கீழ் அதிக வலுவான base model என்பதை அவசியமாக நிரூபிப்பதில்லை.

முடிவை மாற்றிய இரண்டு அமைப்புகள்

இந்த உயர்வுக்குப் பின்னால் உள்ள இரண்டு OpenAI அம்சங்களை மூல உரை குறிப்பிடுகிறது. முதலில், Retained Reasoning, படிகளுக்கிடையில் model-இன் chain of thought-ஐ பாதுகாக்கிறது. இரண்டாவது, Compaction, பழைய context-ஐ truncate செய்வதற்குப் பதிலாக அதைச் சுருக்குகிறது. இவை சேர்ந்து, ஒவ்வொரு action-க்கும் பிறகு இடைநிலை reasoning இழக்கப்பட்ட official harness-இல் GPT-5.6 Sol-ஐ பின்னடைவில் வைத்திருந்த பலவீனத்தைச் சமாளிப்பதாகத் தெரிகிறது.

அத்தகைய persistence, பல படி reasoning tasks-இல் தீர்மானிப்பதாக இருக்க முடியும். ஒரு model முன்னைய முடிவுகளை பாதுகாத்து அவற்றை பயன்படுத்தக்கூடிய context-ஆக சுருக்க முடிந்தால், அது தன் உள் நிலையைக் கட்டமைத்து மீண்டும் உருவாக்க வேண்டிய தேவையைத் தவிர்க்கலாம். வேறு வார்த்தைகளில் சொன்னால், puzzle மாறியதால் benchmark முடிவு மாறவில்லை; பிரச்சினையைத் தீர்க்கும் போது system அதிக செயல்திறனுடன் நினைவில் வைத்துக்கொள்ள அனுமதிக்கப்பட்டதால் மாறியது.

GPT-5.6 Sol's ARC-AGI-3 scores jump dramatically when using OpenAI's custom harness with retained reasoning and compaction, compared to the official test harness. | Image: OpenAI
GPT-5.6 Sol's ARC-AGI-3 scores jump dramatically when using OpenAI's custom harness with retained reasoning and compaction, compared to the official test harness. | Image: OpenAI

எனவே OpenAI-இன் கோரிக்கை, சோதிக்கப்படும் system உண்மையில் என்ன என்பதற்கான விரிவான விளக்கத்தின் மீது தாங்கியிருக்கிறது போல தெரிகிறது. “system” என்பதில் வழங்குநரின் API behavior மற்றும் memory-management features சேர்க்கப்பட்டிருந்தால், 38.3% score பொருத்தமானது. “system” என்பது neutral standardized interface கீழ் உள்ள model-ஐ குறித்தால், அதிகாரப்பூர்வ 7.8% மதிப்பே நேரடியான ஒப்பீட்டு புள்ளியாக இருக்கும்.

ARC Prize-இன் பதில் இரு பார்வைகளுக்கும் இடமளிக்கிறது

வழங்கப்பட்ட மூல உரையின் படி, ARC Prize இணை நிறுவனர் François Chollet, இரண்டு வகையான test setups-ஐ வேறுபடுத்தி பதிலளித்தார். குறிப்பாக பெஞ்ச்மார்க்கைத் தீர்க்கவே உருவாக்கப்பட்ட custom harnesses, அல்லது benchmark format குறித்த அறிவை உடையவை, அனுமதிக்கப்படவில்லை. அதற்கு மாறாக, அனைத்து பயனர்களுக்கும் கிடைக்கக்கூடிய general-purpose API settings ஏற்றுக்கொள்ளத்தக்கவை. compaction-ஐச் சுற்றி, OpenAI-இன் models-ஐ எப்படி சிறப்பாக சோதிப்பது என்பது குறித்து ARC Prize தொடர்ந்தும் விவாதித்துக் கொண்டிருந்ததாகவும், நிறுவனம் “starting to figure out the answer” என்ற நிலைக்கு வந்ததையும் அவர் வரவேற்றதாகவும் கூறினார்.

இந்தப் பதில் முக்கியமானது, ஏனெனில் இது OpenAI-இன் score-ஐ நேரடியாக நிராகரிப்பதில்லை. அதற்கு பதிலாக, general-purpose, பரவலாகக் கிடைக்கக்கூடிய, மற்றும் செலவுடன் வெளிப்படையாக அறிவிக்கப்படும் provider-specific settings-ஐ ARC Prize நியாயமானவையாகக் கருதுகிறது என்பதைச் சுட்டிக்காட்டுகிறது. அதே நேரத்தில், மூல உரை குறிப்பிடுவதுபோல், வெவ்வேறு providers வெவ்வேறு settings-ஐப் பயன்படுத்துவது parity issue-ஐ உருவாக்கக்கூடும். மற்றொரு விதத்தில் சொன்னால், benchmark அமைப்பாளர் சில asymmetry-ஐத் தாங்கத் தயாராக இருப்பது போலத் தெரிகிறது, அதே சமயம் அது நேரடி ஒப்பீடுகளை சிக்கலாக்குகிறது என்பதையும் ஏற்றுக்கொள்கிறார்.

இதனால் விவாதம், OpenAI-இன் முடிவு செல்லுபடியாகிறதா என்பதிலிருந்து, அந்த செல்லுபடித்தன்மை எத்தகையது என்பதற்கு மாறுகிறது. இது GPT-5.6 Sol-ஐ OpenAI-இன் தற்போதைய API stack வழியாக பயன்படுத்தும்போது அதன் செயல்திறனை அளவிடும் விதமாக செல்லுபடியாக இருக்கலாம். ஆனால் வெவ்வேறு கருதுகோள்களின் கீழ் சோதிக்கப்பட்ட models-உடன் நேரடியாக apples-to-apples benchmark முடிவாக இருப்பது அவ்வளவு தெளிவானதாக இல்லை.

AI benchmarking இப்போது என்ன சொல்லுகிறது

இந்த விவாதம் AI evaluation-இல் பரந்த மாற்றத்தை காட்டுகிறது. முன்னணி systems அதிக agentic ஆகவும், நீண்ட horizon workflows-ஐ அதிகமாக நம்புமாறும் ஆகும் நிலையில், benchmark performance மேலும் runtime design choices-ஐ சார்ந்திருக்கும்; அடிப்படை model weights-ஐ மட்டும் அல்ல. Memory retention, context compression, step orchestration, மற்றும் interface design அனைத்தும் முடிவுகளை மாற்றக்கூடும். இது ஒரு static leaderboard மூலம் vendors-ஐ ஒப்பிட முயலும் எவருக்கும் சிக்கலை உருவாக்குகிறது.

இதனால் benchmark consumers மேலும் துல்லியமான கேள்விகளை எழுப்ப வேண்டியதும் பொருள். model default configuration-இல் சோதிக்கப்பட்டதா? vendor-specific features இயக்கப்பட்டதா? harness intermediate reasoning-ஐ பாதுகாத்ததா? செலவுகள் மற்றும் அமைப்புகள் வெளிப்படுத்தப்பட்டனவா? அந்த context இல்லாத headline score, முன்பほど தகவல்மிக்கதாக இல்லாமல் போகிறது.

OpenAI-க்கு, இந்த அறிவிப்பு Anthropic-இன் சமீபத்திய benchmark momentum-ஐ எதிர்க்க நிறுவனம் உறுதியாக இருப்பதை காட்டுகிறது. ARC Prize-க்கு, இந்த பதில் modern API realities-க்கு ஏற்ப விதிகளை மாற்றிக்கொள்ளும் நடைமுறைச் சம்மதத்தைத் தெரிவிக்கிறது; ஆனால் அந்த மாற்றங்கள் benchmark-specific hacks ஆக இருக்கக்கூடாது. மேலும் பரந்த தொழில்துறைக்கு, பாடம் ஒரு குறிப்பிட்ட நாளில் யார் முதலில் என்பதற்கானதல்ல; model performance product-layer intelligence-ஐ சார்ந்த பிறகு, “fair” test-ஐ வரையறுப்பது எவ்வளவு கடினமாகிவிட்டது என்பதற்கானது.

இதனால் benchmark பொருத்தமற்றதாகிவிடவில்லை. அது disclosure-ஐ மேலும் முக்கியமாக்குகிறது. GPT-5.6 Sol-ன் reasoning பாதுகாக்கப்பட்டு, context truncate செய்யப்படுவதற்குப் பதிலாக compact செய்யப்படும்போது அது மிகவும் சிறப்பாக செயல்பட முடியும் என்பதற்கான சான்றாக OpenAI-இன் 38.3% score முக்கியமானது. அதே model benchmark-இன் கடுமையான standard harness-இல் மிக மோசமாக செயல்படுகிறது என்பதற்கான சான்றாக அதிகாரப்பூர்வ 7.8% score முக்கியமானது. இரண்டு எண்களும் உண்மையான ஒன்றைக் கூறுகின்றன. அவை ஒரே விஷயத்தை மட்டும் கூறவில்லை.

இந்தக் கட்டுரை The Decoder-இன் செய்திப்பதிவின் அடிப்படையிலானது. மூல கட்டுரையைப் படிக்கவும்.

Originally published on the-decoder.com