புதிய பெஞ்ச்மார்க் AI-யிடம் கடினமான கேள்வியை முன்வைக்கிறது: முகவர்கள் உதவ முடியுமா என்பதல்ல, அவர்கள் எப்போது மதிப்புள்ளவர்கள்?
AI அமைப்புகள் மேம்படும்போது, நடைமுறையில் மிக முக்கியமான கேள்விகளில் ஒன்று அவை ஒரு பணியை முடிக்க முடியுமா என்பதிலிருந்து, அதை மனிதர்களைவிட குறைந்த மொத்த செலவில் செய்ய முடியுமா என்பதற்குத் தள்ளிச் செல்கிறது. மேம்பட்ட AI அமைப்புகளை மதிப்பீடு செய்யும் ஆராய்ச்சி அமைப்பான METR, இந்தக் கேள்வியை நேரடியாகச் சமாளிக்க ஒரு புதிய அளவைக் முன்வைத்துள்ளது. அது “expenditure horizon” என்று அழைக்கப்படுகிறது. அதன் அடிப்படை எளிமையானது: ஒரே அளவிலான மேம்பாட்டை அடைய AI அமைப்பும் மனிதரும் தத்தம் பக்கம் எவ்வளவு செலவிட வேண்டும் என்பதை ஒப்பிட்டு, செலவு சமமாகும் இடத்தை கண்டறிதல்.
பல சாதாரண AI பெஞ்ச்மார்க்குகள் செயல்திறனை வெற்றி அல்லது தோல்வி என்ற எளிய முடிவாகச் சுருக்கிவிடுவதால் இந்த யோசனை முக்கியம். அந்தத் தேர்வுகள் ஒரு model ஒரு பிரச்சினையைத் தீர்த்ததா என்பதை காட்டலாம்; ஆனால் அதைப் பெறுவதற்கான பொருளாதார பரிமாற்றங்களைப் பற்றி குறைவாகவே சொல்கின்றன. நிறுவனங்கள், ஆய்வகங்கள், மற்றும் கொள்கை நிர்ணயர்கள் AI தானியக்கம் உண்மையில் எங்கே சாத்தியமாக உள்ளது என்பதை தீர்மானிக்கும்போது, அந்த குறைபாடு புறக்கணிக்க முடியாததாக மாறுகிறது.
Expenditure horizon எப்படி செயல்படுகிறது
மூலப் பொருளின்படி, METR-இன் கட்டமைப்பு மனித உழைப்புச் செலவு, AI அமைப்புகளை இயக்கும் செலவு, மற்றும் பரிசோதனைகளில் பயன்படுத்தப்படும் compute ஆகியவற்றை ஒரே ஒப்பீட்டில் இணைக்கிறது. இதன் விளைவாக binary score-க்கு பதிலாக மதிப்பின் தொடர்ச்சியான அளவு கிடைக்கிறது. அதே முன்னேற்றத்திற்குத் தேவைப்படும் மனித செலவைவிட AI-க்கு குறைவான செலவு தேவைப்பட்டால், AI சாதகமான பக்கத்தில் இருக்கும். AI அதிக செலவு தேவைப்படுத்தினால், மனிதர் இன்னும் மலிவான தேர்வாக இருப்பார்.
இந்த அணுகுமுறை பல அமைப்புகள் உண்மையில் முடிவெடுக்கும் முறையோடு பொருந்துவதால் பயனுள்ளது. அவர்கள் பொதுவாக AI எதையாவது வெளியிட முடியுமா என்பதையே கேட்பதில்லை. oversight, experimentation, retries, மற்றும் infrastructure ஆகியவற்றை சேர்த்துப் பார்த்த பின் அது செலவையோ நேரத்தையோ குறைக்கிறதா என்பதே கேள்வி. ஒரு demo-வில் சிறப்பாகத் தோன்றும் agent, மிகுந்த compute-ஐச் செலவழித்தாலோ அல்லது அதிக ஆதரவு ஓட்டங்களை வேண்டியிருந்தாலோ அந்தச் சோதனையில் தோல்வியடையலாம்.
METR இந்த முறைக்கு பாரம்பரிய மதிப்பீடுகளைக் காட்டிலும் இரண்டு முக்கியமான நன்மைகள் உள்ளன என்று கூறுகிறது. முதலில், அது pass-fail label-க்கு பதிலாக நுணுக்கமான பொருளாதார மதிப்பை அளிக்கிறது. இரண்டாவதாக, பல தனித்தனியான உள்ளீடுகளை ஒரே நாணயத்தில் மாற்றுகிறது, இதனால் மனித மற்றும் இயந்திர உழைப்பை ஒரே கட்டமைப்பில் ஒப்பிடுவது எளிதாகிறது.
NanoGPT speedrun-களில் யோசனையைச் சோதித்தல்
இந்த அளவைக் களத்தில் சோதிக்க METR NanoGPT speedrun-ஐ பயன்படுத்தியது. இது ஒரு பொது சமூகத் திட்டம்; இதில் பங்கேற்பவர்கள், பணியை மாற்றாமல் பயிற்சி அணுகுமுறையை மேம்படுத்தி, standard hardware-ல் ஒரு language model-ஐ மிக விரைவாக train செய்வதில் போட்டியிடுகிறார்கள். நோக்கம் நிலையாக இருப்பதால், செயல்திறன் மேம்பாடுகளை காலப்போக்கில் கண்காணிக்க முடியும் என்பதால், இது ஒப்பீட்டிற்கு மிகவும் தெளிவான சூழலை வழங்குகிறது.

மூலத்தின் படி, இந்த speedrun மே 2024 முதல் 82 documented improvement steps-ஐ பதிவு செய்தது. இதனால் மொத்த training time சுமார் 45 நிமிடங்களில் இருந்து இரண்டு நிமிடங்களுக்கும் குறைவாகக் குறைந்தது. இந்த வரலாற்றுப் பதிவால் ஒவ்வொரு சிறிய முன்னேற்றத்திற்கும் எவ்வளவு மனித உழைப்பு சென்றது என்பதை METR மதிப்பிட முடிந்தது, பின்னர் அதனை அதே முன்னேற்றத்தை AI systems மூலம் பெறச் செலவாகும் தொகையுடன் ஒப்பிட முடிந்தது.
மனித உழைப்பை மதிப்பிடுவதற்காக, METR திட்டத்தின் மிகவும் செயல்பாட்டுள்ள இரண்டு பங்கேற்பாளர்களை நேர்காணல் செய்தது, மேலும் Opus-4.6 என்ற AI model-ஐப் பயன்படுத்தி ஒவ்வொரு முன்னேற்றத்துக்குப் பின்னுள்ள பணியை மதிப்பிட்டது. இரு அணுகுமுறைகளும் ஒரே மாதிரியான சுமார் எண்ணிக்கையை வழங்கின: ஒவ்வொரு 1% speedup-க்கும் சுமார் 16 மணி நேர வேலை. மூலத்தின் படி, மனிதப் பக்கம் ஒவ்வொரு 1% speedup-க்கும் சுமார் $2,500 செலவாக இருந்தது.
AI agents-க்கு ஆரம்ப முடிவு ஏன் நிதானமற்றதாக உள்ளது
மூலத்தில் விவரிக்கப்பட்ட ஆரம்பக் கண்டுபிடிப்பு வெற்றிகரமானது என்று சொல்ல முடியாது. இந்த பெஞ்ச்மார்க்கில், expenditure horizon இன்றைய agents-க்கு சற்றே ஏமாற்றமளிப்பதாகத் தோன்றுகிறது. இதன் பொருள் AI systems optimization-heavy பணியில் பயனற்றவை என்பதல்ல. ஆனால் முழுச் செலவுகளையும் கணக்கிட்டால், அதிக கடினமான அல்லது அதிக செலவுள்ள மேம்பாட்டு பணிகளில் மனித பங்களிப்பாளர்களை விட மேலோங்கத் தடைபடலாம் என்பதைக் காட்டுகிறது.
இது AI மதிப்பீட்டில் பரவலாக உள்ள உள்ளுணர்வுடன் பொருந்துகிறது: agents பொதுவாகச் சிறிய, குறைந்த செலவு, நன்றாக வரையறுக்கப்பட்ட பிரச்சினைகளில் வலுவாகத் தோன்றுகின்றன. ஆனால் பணிகள் சிக்கலாகவும் செலவாகவும் மாறும்போது, அவர்களின் மேலாதிக்கம் குறைகிறது. மூல உரை METR முந்தைய சோதனைகளிலும் இதைப் போன்றதை கண்டதாகச் சொல்கிறது. AI எளிய, குறைந்த செலவுள்ள பணிகளில் மனிதர்களை வெல்ல முடியும்; ஆனால் பட்ஜெட்டுகள் உயர்ந்து பிரச்சினைகள் கடினமாகும்போது, மனிதர்களே அதிக பொருளாதாரமான தேர்வாக மாறுகிறார்கள்.
தானாக இயங்கும் AI engineering குறித்து பரவும் மிகைப்படுத்தப்பட்ட கதைகளுக்கு இது ஒரு முக்கிய திருத்தம். ஒரு agent விரைவாக பயனுள்ள மாற்றத்தை உருவாக்க முடிந்தால், அது குறுகிய செயல்பாட்டு எல்லைக்குள் செலவுத்திறனாக இருக்கலாம். ஆனால் அதற்கு விரிவான experimentation, மீண்டும் மீண்டும் prompting, பெரிய inference bill-கள், அல்லது விலையுயர்ந்த ஆதரவு compute தேவைப்பட்டால், வணிக நியாயம் விரைவில் சிதையும். அந்தச் சிதைவு எங்கு தொடங்குகிறது என்பதைத் துல்லியமாக அளவிடுவதற்கான முயற்சிதான் expenditure horizon.

அளவு என்ன தெளிவாக்குகிறது, என்ன விடுபடுகிறது
METR-இன் முன்மொழிவின் மதிப்பு, உரையாடலை raw capability-யிலிருந்து cost-adjusted capability-க்குத் திருப்புகிறது என்பதுதான். இது அதிகக் கடுமையான தரநிலை; நிஜ உலகப் பயன்பாட்டிற்கு அது சரியானதுமானது. நிறுவனங்கள் கருவிகளை அவை புதுமையானவை என்பதால் ஏற்கவில்லை. அவை throughput-ஐ உயர்த்துவதால், செலவைக் குறைப்பதால், திறனை விரிவுபடுத்துவதால், அல்லது இவற்றின் கலவையால் ஏற்கின்றன. அந்த முடிவுகளைப் பற்றி பேச முடியாத பெஞ்ச்மார்க்கின் நடைமுறை மதிப்பு குறைவானதே.
அதே நேரத்தில், மூல உரை இந்த அளவுக்கு சில கண் மறைப்புகளும் உள்ளன என்று குறிப்பிடுகிறது. மனித உழைப்பு, பரிசோதனை compute, மற்றும் AI செயல்பாடு ஆகியவற்றை ஒரே dollar comparison-ஆகச் சுருக்கும் எந்தவொரு கட்டமைப்பும் சில முன்கணிப்புகளை உள்ளடக்கும். மனிதப் பணியின் தரம் மாறுபடலாம். மணிநேரக் கட்டணங்களும் மாறலாம். சில AI-generated கருத்துகளை எளிதில் நிராகரிக்கலாம்; மற்றவை பெரும் முன்னேற்றத்தைத் தரலாம். benchmark task-இன் தேர்வும் முக்கியம். NanoGPT speedrunning பொதுவானது, அளவிடக்கூடியது, தொழில்நுட்ப ரீதியாக பொருத்தமானதும் தான்; ஆனால் அது இன்னும் ஒரு துறையே.
மூலத்தில் இன்னொரு முக்கியமான எச்சரிக்கை உள்ளது: புதிய தலைமுறை model-கள் படத்தை விரைவாக மாற்றக்கூடும். இன்றைய ஏமாற்றமளிக்கும் expenditure horizon அடுத்த ஆண்டுக்கான முடிவாகாது. model quality மேம்பட்டால், tool use அதிக நம்பகத்தன்மை பெற்றால், அல்லது inference costs குறைந்தால், மனித மற்றும் AI பொருளாதாரத்திற்கிடையேயான crossover point குறிப்பிடத்தக்க அளவில் நகரலாம்.
ஒரு பெஞ்ச்மார்க்கைத் தாண்டி இது ஏன் முக்கியம்
இந்தக் கவனிக்க வேண்டிய அம்சங்களுடன் கூட, METR-இன் முன்மொழிவு பொருத்தமான நேரத்தில் வருகிறது. AI குறித்த உரையாடல்கள் productivity, acceleration, மற்றும் self-improving systems பற்றிய கூற்றுகளால் நிரம்பியுள்ளன. அந்த விவாதத்தின் பெரும்பகுதி இன்னும் கோட்பாட்டுத் தன்மையில் இருக்கிறது, ஏனெனில் மனித மற்றும் இயந்திர உழைப்பை சமநிலையிலான அடிப்படையில் ஒப்பிடும் பொதுவான வழிகள் துறையில் இல்லை. expenditure horizon அதற்கான ஒரு வழியை உருவாக்கும் முயற்சி.
இதன் மிகப்பெரிய பங்களிப்பு தொழில்நுட்பத்தை விட கலாச்சார ரீதியாக இருக்கலாம். இது மதிப்பீட்டை நாடகமயமான demos-இலிருந்து பட்ஜெட் நிஜத்திற்குத் தள்ளுகிறது. நிறுவனங்கள் அதிகரிக்கும் AI செலவுகளுக்கு அளவிடக்கூடிய returns-ஆல் நியாயம் சொல்ல வேண்டிய சந்தையில் இது சரியான அழுத்தம். இந்த முறை பரவினால், எங்கு agents உண்மையில் பொருளாதாரமானவை, எங்கு அனைத்து செலவுகளையும் சேர்க்கும்வரை அவை திறமையாகத் தோன்றுகின்றன என்பதைக் கண்டறிய உதவும்.
தற்போதைக்கு, METR-இன் ஆரம்ப முடிவுகள் ஒரு கட்டுப்படுத்தப்பட்ட முடிவைச் சொல்கின்றன. AI agents சில குறுகிய optimization tasks-இல் பயனுள்ளவையாக இருக்கலாம், ஆனால் அவற்றின் செலவு முன்னிலை தானாகவே இருப்பதாகக் கருதக்கூடாது. வாங்குபவர்களுக்கும் உருவாக்குபவர்களுக்கும் மிக முக்கியமான இடங்களில், கேள்வி இனி model என்ன செய்ய முடியும் என்பதல்ல. கேள்வி, அது ஒரு மனிதனைவிட குறைந்த செலவில் என்ன செய்ய முடியும் என்பதே.
இந்தக் கட்டுரை The Decoder செய்தியளிப்பை அடிப்படையாகக் கொண்டது. மூலக் கட்டுரையைப் படிக்கவும்.
Originally published on the-decoder.com


