GPT-6 Astra வலுவான எண்களுடன், முரண்பட்ட மதிப்பெண் அட்டைகளுடன், மேலும் தெளிவான செயல்திறன் கதையுடன் வெளிப்படுகிறது
OpenAI-ன் GPT-6 Astra அசாதாரணமாக முரண்பட்ட முறையில் வரவேற்கப்படுகிறது: ஒரு பெஞ்ச்மார்க் தொகுப்பாளர் அதை மாதிரி துறையின் முன்னிலையில் தெளிவாக வைக்கிறது, மற்றொன்று அதை மொத்தத்தில் அதன் முன்னோடியுடன் சமமாக மட்டுமே காண்கிறது, மேலும் ஒரு பிரதான reasoning சோதனை முற்றிலும் வேறொரு வகையான முன்னேற்றத்தை சுட்டிக்காட்டுகிறது. இதன் விளைவு, “எந்த மாதிரி சிறந்தது?” என்ற கேள்விக்கான பதில் எந்த அளவீடு பார்க்கப்படுகிறது, அதற்காக எவ்வளவு compute தேவைப்படுகிறது என்பதைக் கொண்டு அதிகமாக மாறும் இன்றைய AI போட்டியின் வெளிப்படுத்தும் ஒரு காட்சிப் பதிவு.
The Decoder வெளியிட்ட புதிய மதிப்பீடுகளின் சுருக்கத்தின்படி, Epoch AI 50-க்கும் மேற்பட்ட பெஞ்ச்மார்க்களை ECI score-ஆக ஒன்றிணைத்து GPT-6 Astra-வை 169 புள்ளிகளுடன் முதலிடத்தில் வைக்கிறது, 267 models-ஐ முந்தி. அதற்கு மாறாக, Artificial Analysis Astra-க்கு அதன் Intelligence Index-ல் 61 புள்ளிகள் அளிக்கிறது, இது Astra-வின் முன்னோடி Sol-உடன் சரியாக சமம், மேலும் Anthropic-ன் Claude Fable 5.1-இன் 66 புள்ளிகளுக்குப் பின்னால். இந்த முரண்பாடு ஒரு சிறிய முறையியல் குறிப்பு அல்ல. இது, முன்னணி முன்னேற்றத்தை தொழில் தற்போது எப்படி விளக்குகிறது என்பதன் மையத்தையே தொடுகிறது.
இந்த பிரிவை புரிந்துகொள்ள முயற்சிக்கும் வாசகர்களுக்கு, எளிய விளக்கம் என்னவெனில் இந்த பெஞ்ச்மார்க் தொகுப்புகள் வேறுபட்டவற்றை முன்னிலைப்படுத்துகின்றன. ஒரு பரந்த composite பலவகை பணிகளில் தொடர்ச்சியான முன்னேற்றங்களைப் பரிசளிக்கலாம், மற்றொன்று knowledge retrieval, coding, அல்லது long-context comprehension போன்ற தேர்ந்தெடுக்கப்பட்ட துறைகளில் பலவீனமான செயல்திறனை அதிக கடுமையுடன் தண்டிக்கலாம். எனவே அதே மாதிரி ஒரு கட்டமைப்பில் தீர்க்கமான தலைவராகவும், மற்றொரு கட்டமைப்பில் கிடைமட்ட நகர்வாகவும் தோன்றலாம்.
செயல்திறன் தான் அதிக முக்கியமான சிக்னலாக இருக்கலாம்
வழங்கப்பட்ட அறிக்கையில் மிக கவனத்தை ஈர்க்கும் கூற்று வெறும் raw score நிலை பற்றியது மட்டும் அல்ல. அது செயல்திறன் பற்றியது. The Decoder-ன் கூற்றுப்படி Astra, Sol பயன்படுத்தும் compute steps-இன் சுமார் மூன்றில் ஒன்றை மட்டும், மேலும் Opus 5 பயன்படுத்துவதன் ஐந்தில் ஒன்றை மட்டும் பயன்படுத்துகிறது. coding tasks-இல், Artificial Analysis Astra-வை Claude Fable 5-உடன் சமமாக மதிப்பிட்டதாகவும், ஆனால் ஒரு task-க்கு செலவு பாதிக்குமேல் குறைவாக இருந்ததாகவும் தெரிவித்துள்ளது. இப்படிப்பட்ட முடிவு முக்கியம், ஏனெனில் frontier போட்டி இனி சிறந்த பதிலை அடைவது பற்றியே மட்டும் அல்ல. அதைப் பொருளாதார ரீதியாக எவ்வளவு திறமையாக ஒரு மாதிரி அடைய முடிகிறது என்பதையும் பற்றியது.
இந்த வேறுபாடு மாதிரியின் pricing profile-இல் இன்னும் கூர்மையாகிறது. OpenAI, Astra-க்கு செயலாக்கப்பட்ட உரையின் ஒரு unit-க்கு Sol-ஐ விட இரண்டரை மடங்கு அதிகமாக கட்டணம் வசூலிப்பதாகவும், இதனால் ஒரு task முன்பை விட சுமார் 75 சதவீதம் அதிக செலவாக இருப்பதாகவும் கூறப்படுகிறது. வெளிப்படையாகப் பார்த்தால், இது செலவில் ஒரு குறிப்பிடத்தக்க உயர்வாகத் தெரிகிறது. ஆனால் The Decoder-ன் விவரம், Astra-வின் compute சிக்கனமானது போட்டியாளரைப் பொறுத்து ஒப்பீட்டை மாற்றுகிறது என்று தெரிவிக்கிறது. அதன் சொந்த முன்னோடியுடன் ஒப்பிடும்போது Astra அதிக செலவாகத் தோன்றுகிறது. ஆனால் மிக அதிக கணிப்பொறி பயன்படுத்தும் rival models-உடன் ஒப்பிடும்போது, சில workloads-க்கு அது இன்னும் ஒப்பீட்டளவில் திறமையாகத் தோன்றலாம்.
நடைமுறையில், இதுவே frontier market-இன் புதிய பதற்றம். ஒரு மாதிரி API நிலை에서 அதிக செலவாக இருந்தாலும், குறைந்த reasoning steps, குறைந்த token consumption, அல்லது அதிக மதிப்புள்ள tasks-இல் சிறந்த success rates மூலம் வேலை முடிப்பதால் மதிப்பை உயர்த்த முடியும். developers மற்றும் enterprise buyers-க்கு, இந்த tradeoffs எந்த single leaderboard position-ஐவிட அதிக முக்கியத்துவம் பெறக்கூடும்.
ARC-AGI-3 உரையாடலை மாற்றுகிறது
அறிக்கையின் மிகப் பெரிய தலைப்புச் செய்தி போல இருக்கும் முடிவு ARC-AGI-3-இல் இருந்து வருகிறது, இது unfamiliar game worlds-ஐ மையமாகக் கொண்ட ஒரு benchmark. அங்கு GPT-6 Astra 62.7 சதவீதத்தை எட்டியதாகவும், Sol-இன் 7.8 சதவீதத்தையும், Opus 5-இன் 30.2 சதவீதத்தையும் தெளிவாக முந்தியதாகவும் கூறப்படுகிறது. அந்த சோதனையில் Astra, முதல்முறையாக, சராசரி மனிதனைவிட அதிக செயல்திறன் கொண்டதாக இருந்ததாக கட்டுரை சொல்கிறது. ARC Prize chief François Chollet, முன்னேற்றத்தின் வேகம் தாம் எதிர்பார்த்ததைக் காட்டிலும் சுமார் இருமடங்கு வேகமாக இருப்பதாகவும், தனது AGI forecast-ஐ முன்கூட்டியே மாற்றியதாகவும் கூறியதாக விவரிக்கப்படுகிறார்.
இந்த framing இருந்தாலும், பரந்த பாடம் ஒரு அதிரடியான சதவீதத்தை விட, எந்த வகையான திறன் பரிசளிக்கப்படுகிறது என்பதுதான். ARC-style evaluations abstraction மற்றும் adaptation-ஐ சோதிக்க உருவாக்கப்பட்டவை, எளிய memorization-ஐ அல்ல. அங்கு வலுவான செயல்திறன் symbolical weight-ஐக் கொண்டது, ஏனெனில் அது training-இன் போது பார்த்த pattern-களை மீண்டும் உருவாக்குவது மட்டுமல்ல, அறிமுகமில்லாத கட்டமைப்புகளை கையாளுவதிலும் மாதிரிகள் மேம்படுகின்றன என்பதற்கான சான்றாக அடிக்கடி கருதப்படுகிறது.
அதையடுத்து, அதே வழங்கப்பட்ட உரை Astra எல்லா இடங்களிலும் ஒரே மாதிரியாக வலுவாக இல்லை என்பதை தெளிவுபடுத்துகிறது. Artificial Analysis, மாதிரி GDPval-AA v2-இல் சுமார் 80 Elo points இழந்ததாகவும், banking support, SciCode, மற்றும் long-context reasoning பணிகளில் சரிந்ததாகவும் தெரிவிக்கிறது. இந்த சமச்சீரற்ற சுயவிவரம் முக்கியமானது. இது Astra ஒரு flat improvement ஆக இல்லாமல், அதிகமாக specialized அல்லது கடுமையாக optimized செய்யப்பட்ட அமைப்பாக இருக்கலாம் என்பதைக் காட்டுகிறது.
சுத்தமான output-கள், சமமற்ற முன்னேற்றங்கள்
Astra-வின் மிகவும் நடைமுறைரீதியான மேம்பாடுகளில் ஒன்று அதன் குறைந்த hallucination rate ஆக இருக்கலாம். AA-Omniscience-இல், The Decoder 92 சதவீதத்திலிருந்து 51 சதவீதமாக குறைந்ததாக அறிக்கை செய்கிறது. இது இன்னும் குறிப்பிடத்தக்க hallucination rate தான், ஆனால் ஆதரிக்கப்படாத கூற்றுகள் ஆபத்தை உருவாக்கும் workflows-இல் இந்த மாற்றம் செயல்பாட்டில் முக்கியமான அளவு பெரியது. applied AI teams-க்கு, இப்படியான குறைப்பு leaderboard-இல் கிடைக்கும் சிறிய நகர்வைவிட மதிப்புமிக்கதாக இருக்கலாம், குறிப்பாக ஆராய்ச்சி, coding, மற்றும் business decision support போன்ற நம்பகத்தன்மை adoption-க்கு gate ஆக இருக்கும் இடங்களில்.
அறிக்கை ஒரு கடினமான mathematics benchmark-இல் அரிதான செயல்திறனையும் சுட்டிக்காட்டுகிறது. Epoch AI கூறுவதாவது, Astra $300-per-attempt budget-க்குள் Lean-verified proofs உடன் open FrontierMath Erdős problems 68-இல் இரண்டைத் தீர்த்த ஒரே மாதிரி. கூடுதலாக, extra, non-standardized runs-இல் 220,000 டாலருக்கும் மேலான compute பயன்படுத்தி மேலும் மூன்று தீர்வுகள் தோன்றின, ஆனால் அவை score-இல் கணக்கில் கொள்ளப்படவில்லை. அந்த caveat மிக முக்கியம். இது மாதிரியின் சாத்தியமான உச்சத்தையும், அமைப்புகளை நியாயமாக ஒப்பிடும்போது cost-bounded evaluation-ன் முக்கியத்துவத்தையும் காட்டுகிறது.
Leaderboard சிந்தனையின் வரம்புகளை வெளிப்படுத்தும் ஒரு model launch
ஆகவே ஆரம்ப Astra படம் எளிய hype-உம் அல்ல, நேரடி disappointment-உம் அல்ல. இது frontier AI evaluation-ஐ ஒரே ranking-ஆக சுருக்குவது ஏன் கடினமாகியுள்ளது என்பதற்கான ஒரு case study. ஒரு benchmark family Astra தலைவரென்கிறது. மற்றொன்று அது அதன் முன்னோடியுடன் மொத்தத்தில் சமம் என்கிறது. ஒரு reasoning benchmark, திறமையான problem-solving-இல் அசாதாரணமாக முக்கியமான leap-ஐ சுட்டிக்காட்டுகிறது. task-level measurements coding economy மற்றும் குறைந்த hallucination-இல் முன்னேற்றங்களை காட்டுகின்றன, ஆனால் பிற பகுதிகளில் பின்னடைவுகளையும் காட்டுகின்றன.
அந்த சிக்கல்தான் உண்மையான கதை எனத் தோன்றுகிறது. மாதிரிகள் முதிர்ச்சியடையும்போது, தொழில் ஒரு headline score capability-க்கு பதிலாக நிற்கும் காலத்திலிருந்து நகர்கிறது. GPT-6 Astra-ன் முக்கியத்துவம், குறிப்பாக efficiency மற்றும் சில வகையான abstract reasoning சுற்றியுள்ள தெரிவுசெய்யப்பட்ட முன்னேற்றங்களில் இருக்கலாம், எல்லா பரிமாணங்களிலும் ஆதிக்கத்தில் அல்ல. வாங்குபவர்களுக்கு, ஆராய்ச்சியாளர்களுக்கு, மற்றும் போட்டியாளர்களுக்கு, இது சுத்தமான வெற்றியைவிட அதிக சுவாரசியமானதாகிறது, ஏனெனில் AI போட்டியின் அடுத்த கட்டம் உண்மையில் எங்கே தீர்மானிக்கப்படலாம் என்பதற்கான சைகையை அது அளிக்கிறது.
இந்தக் கட்டுரை The Decoder வெளியிட்ட செய்தியை அடிப்படையாகக் கொண்டது. அசல் கட்டுரையை படிக்கவும்.
Originally published on the-decoder.com





