AI பெஞ்ச்மார்க் கசிவை அடைக்க Google நகர்கிறது
முக்கியமான AI அமைப்புகளை மதிப்பீடு செய்யும் புதிய முறையை Google Deepmind சோதித்து வருவதாகக் கூறுகிறது; இதில் சோதனை கேள்விகளும் மாடலும் வெளிப்படுத்தப்படாது. ஒரு சொந்தமான frontier AI மாடலின் முதல் இரட்டை-மறைவு மதிப்பீடு என விவரிக்கப்படும் இந்த முன்னோடி முயற்சி, துறையின் நீடித்த அளவீட்டு சிக்கல்களில் ஒன்றான benchmark contamination-ஐ இலக்காகக் கொண்டுள்ளது.
பிரச்சனை எளிமையானதுதான், ஆனால் அதன் விளைவுகள் முக்கியமானவை. பயிற்சி அல்லது optimization காலத்தில் ஒரு மாடல் ஏற்கெனவே பெஞ்ச்மார்க் கேள்விகளை உள்வாங்கியிருந்தால், வலுவான மதிப்பெண்களை விளக்குவது கடினமாகிறது. அத்தகைய முடிவு பரந்த திறனை விட நினைவுபடுத்தல், நேரடி வெளிப்பாடு அல்லது தேர்வு-சார்ந்த tuning-ஐ பிரதிபலிக்கலாம். நிறுவனங்கள், ஆராய்ச்சியாளர்கள், ஒழுங்குபடுத்துநர்கள் மற்றும் வெளியக மதிப்பீட்டாளர்களுக்கு, மாடல்களை ஒப்பிடவும் அபாயத்தை மதிப்பிடவும் பயன்படுத்தப்படும் முக்கிய கருவிகளில் ஒன்றின் மீதான நம்பிக்கையை இது குறைக்கிறது.
வழங்கப்பட்ட அறிக்கையின்படி, Google-ன் அணுகுமுறை ரகசிய சோதனைப் பொருட்களை cryptographically protected சூழலில் வைக்கிறது; இதனால் மாடல் வழங்குநர் prompts-ஐ முன்கூட்டியே பார்க்க முடியாது. அதே நேரத்தில், மதிப்பீட்டாளருக்கு model weights-க்கு அணுகல் கிடைக்காது. இத்தகைய அமைப்பு, வெளிப்புற சோதனையில் நீண்ட காலமாக இருந்த சமநிலையின்மையை நீக்குவதை நோக்கமாகக் கொண்டது; வழக்கமாக ஒரு பக்கம் sensitive benchmark data-ஐ ஒப்படைக்க வேண்டும் அல்லது proprietary model assets-ஐ பகிர வேண்டும்.
Gemini Flash Lite-ஐ மையமாகக் கொண்ட முன்னோடி
இந்த முன்னோடி திட்டம் Gemini Flash Lite வரிசையைச் சேர்ந்த ஒரு மாடலைப் பயன்படுத்துகிறது, மேலும் Singapore AI Safety Institute உள்ளிட்ட கூட்டாளிகளுடன் confidential benchmarks-க்கு எதிராக இயங்குகிறது. இரு தரப்புகளின் தனியுரிமையையும் காக்கும் நிலையிலேயே, கடுமையான வெளிப்புற மதிப்பீட்டைச் செய்ய முடியும் என்பதே தெரிவிக்கப்பட்ட இலக்கு. நடைமுறையில், benchmark Google-க்கு மறைக்கப்பட்டிருக்கும், மேலும் மாடலின் உட்புற விவரங்கள் மதிப்பீட்டாளரிடமிருந்து மறைக்கப்பட்டிருக்கும்.
இது முக்கியமானது, ஏனெனில் மேம்பட்ட மாடல் சோதனை அதிகரித்து வரும் அளவில் sensitive materials-ஐ சார்ந்துள்ளது. cybersecurity, misuse potential அல்லது அரசு நடத்தும் மதிப்பீடுகள் போன்ற துறைகளில், benchmark prompts தாமே மதிப்புமிக்கவையாகவோ ஆபத்தானவையாகவோ இருக்கலாம். அந்தக் கேள்விகள் கசிந்தால், சோதனை அதன் மதிப்பின் பெரும்பகுதியை இழக்கலாம். model weights-ஐ ஒப்படைக்குமாறு மாடல் வழங்குநர்களிடம் கேட்கப்பட்டால், அவர்கள் தங்கள் intellectual property மற்றும் security கவலைகளை எதிர்கொள்ள வேண்டியிருக்கும்.
இந்த புதிய செயல்முறை, இரு பிரச்சனைகளையும் ஒரே நேரத்தில் தீர்க்கும் முயற்சியாக கட்டுரையில் வடிவமைக்கப்பட்டுள்ளது. Google Cloud-ன் confidential computing portfolio-விலுள்ள Confidential Space-ஐ பயன்படுத்தி பாதுகாக்கப்பட்ட execution environment ஒன்றை உருவாக்குவதாக Google கூறுகிறது. இதன் நோக்கம் கொள்கை சார்ந்த ரகசியத்தன்மையோ ஒப்பந்த அடிப்படையிலான கட்டுப்பாடோ மட்டும் அல்ல; cryptographic verification ஆதரவுடன் கூடிய தொழில்நுட்பத் தனிமைப்படுத்தலாகும்.
Benchmark contamination ஏன் பெரிய பிரச்சனையாக மாறியுள்ளது
Machine learning-இல் benchmark contamination புதிய கவலையல்ல; ஆனால் மாடல்கள் பெரிதாகும் போது, பயிற்சி தரவு விரிவடையும் போது, போட்டி அழுத்தம் அதிகரிக்கும் போது இது மேலும் தீவிரமாகிறது. Proprietary frontier systems, internet-scale மற்றும் curated data-வின் பெரும் அளவுகளில் பயிற்றுவிக்கப்படுகின்றன. இதனால் benchmark போன்ற பொருட்கள், அல்லது அவற்றின் நெருக்கமான வடிவங்கள், ஏற்கெனவே training pipeline-இல் சேர்ந்திருக்க வாய்ப்பு அதிகரிக்கிறது.
ஒரு benchmark நேரடியாக சேர்க்கப்படாவிட்டாலும், fine-tuning, மனித feedback loops, synthetic training material, அல்லது test formats பற்றிய மீண்டும் மீண்டும் நிகழும் பொது விவாதத்தால் தூண்டப்படும் optimization வழியாக leakage நிகழலாம். அது நடந்துவிட்டால், தலைப்புச் செய்திகள் அளிக்கும் மதிப்பெண்கள் நிஜ உலகத் திறனை மீறிக் காட்டக்கூடும். வெளியக பார்வையாளர்களுக்கு, benchmark பொதுமைப்படுத்தலை அளவிடுகிறதா அல்லது rehearsal-ஐயா என்பதே மையக் கேள்வியாகிறது.
Google-ன் முன்மொழியப்பட்ட பதில் நடைமுறை சார்ந்ததும் தொழில்நுட்ப சார்ந்ததும் ஆகும்: சோதனையை மாடல் உருவாக்குநருக்கு மறைவாக வைத்திருக்கவும், மாடலை சோதனை உரிமையாளருக்கு மறைமுகமாக வைத்திருக்கவும். இது ஒவ்வொரு மதிப்பீட்டு பிரச்சனையையும் நீக்காது, ஆனால் மிகக் கேடான ஒன்றை நேரடியாக குறிவைக்கிறது. மாடல் முன்கூட்டியே prompts-ஐ பார்க்க முடியாவிட்டால், அவை தொடர்பான உருப்படிகளுக்காக குறிப்பாக optimize செய்ய provider-க்கு குறைவான வாய்ப்புகள் இருக்கும்.
சிறப்பு வாய்ந்த வெளிப்புற மதிப்பீடுகளுக்கு முன்பு ஒரு சமரசம் தேவைப்பட்டதாகவும் அந்த அறிக்கை குறிப்பிடுகிறது. மதிப்பீட்டாளர்கள் prompts-ஐ ஒப்படைத்து, provider அவற்றை வைத்திருக்கவோ தவறாக பயன்படுத்தவோ மாட்டார்கள் என்று நம்ப வேண்டியிருந்தது; அல்லது providers model weights-ஐ பகிர்ந்து, அதனுடன் வரும் வெளிப்பாட்டை ஏற்க வேண்டியிருந்தது. இரட்டை-மறைவு அமைப்பு அந்தத் தேர்வை நீக்குவதை நோக்கமாகக் கொண்டுள்ளது.
இது Google பிரச்சனை மட்டும் அல்ல, முழுத் துறையின் நம்பிக்கை பிரச்சனை
இதன் பரந்த முக்கியத்துவம் என்னவென்றால், AI benchmarking இப்போது ஒரு governance பிரச்சனையாக மாறியுள்ளது; வெறும் leaderboard பிரச்சனையாக அல்ல. மதிப்பெண்கள் product launches, enterprise procurement, safety debates, மற்றும் policy discussions-இல் அதிகமாக மேற்கோள் காட்டப்படுகின்றன. இந்தக் கூற்றுகளுக்குப் பின்னால் உள்ள சோதனைகள் நம்பகமானவையாக இல்லையெனில், AI செயல்திறன் குறித்த பொது evidence base-இன் பெரிய பகுதி குறைவான நம்பகத்தன்மை பெறுகிறது.
Anthropic-இன் Fable 5-க்கான சமீபத்திய ARC-AGI மதிப்பீடு தாமதமான ஒரு உதாரணத்தையும் கட்டுரை சுட்டிக்காட்டுகிறது; அங்கு data-retention கட்டுப்பாடுகள் சுயாதீன சோதனையை சிக்கலாக்கின. வலுவான மாடல்களும் ரகசிய வெளிப்புற பெஞ்ச்மார்க்குகளும் சந்திக்கும் போது உருவாகும் செயல்பாட்டு friction-ஐ அந்த உதாரணம் காட்டுகிறது. வழங்கப்பட்ட அறிக்கையிலிருந்து கிடைக்கும் inference: அத்தகைய மதிப்பீடுகளை இரு தரப்பிலும் அசௌகரியமான disclosure-க்கு தள்ளாமல், எளிதாக நடத்த Google தனது முன்னோடியை நிலைநிறுத்துகிறது.
இங்கே ஒரு standard-setting ஆவலும் உள்ளது. அதிக நம்பகத்தன்மை கொண்ட, பரவலாக நம்பப்படும் AI systems-ஐ உருவாக்க இந்த முயற்சி உதவும் என Google கூறுகிறது. அந்தக் கூற்றை கவனமாகப் பார்க்க வேண்டும். ஒரு pilot என்பது துறைமுழுவதற்கான தீர்வு அல்ல; benchmark நம்பிக்கை prompts ரகசியமாக இருப்பதிலேயே முடிவடைவதில்லை. test design தரம், statistical rigor, reproducibility, benchmark scope, மற்றும் evaluator independence ஆகியவை இன்னும் முக்கியம். ஆனால் testing process-ஐச் சுற்றியுள்ள தொழில்நுட்ப பாதுகாப்பு, stack-இன் அர்த்தமுள்ள பகுதியாக மாறக்கூடும்.
அடுத்ததாக கவனிக்க வேண்டியது
மிக முக்கியமான அடுத்த கேள்வி, இந்த முறை ஒரே முன்னோடியைத் தாண்டி பரவுமா என்பதே. மற்ற முக்கிய model developers, independent institutes, மற்றும் அரசு மதிப்பீட்டாளர்கள் இதே போன்ற механизмங்களை ஏற்றுக்கொண்டால், இந்த அணுகுமுறை frontier-model oversight-இன் சாதாரண பகுதியாக மாறலாம். அது ஒருமுறை காட்டப்படும் demo-களுக்கு மட்டுமே கட்டுப்பட்டால், அதன் தாக்கம் குறைந்ததாக இருக்கும்.
மற்றொரு திறந்த கேள்வி, எந்த வகையான மதிப்பீடுகள் அதிக பயன் பெறுகின்றன என்பதாகும். prompts தாமே sensitive ஆக இருக்கக்கூடியதால், cybersecurity மற்றும் government testing குறிப்பாக வலுவான candidates என கட்டுரை சொல்கிறது. அந்த தர்க்கம் சில biosecurity, national security, அல்லது commercial red-team சூழல்களுக்கும் விரிவடையலாம்; ஆனால் வழங்கப்பட்ட உரை அவற்றை நேரடியாக குறிப்பிடவில்லை.
இப்போது, முக்கிய முன்னேற்றம் தெளிவாக உள்ளது: Google Deepmind, AI benchmarking-ஐ trust-me ஏற்பாடுகளிலிருந்து விலக்கி, தொழில்நுட்ப ரீதியாக enforced confidentiality-க்கு நகர்த்த முயல்கிறது. செயல்திறன் குறித்த கூற்றுகள் அவற்றை உருவாக்கும் systems போலவே தீவிரமாக விவாதிக்கப்படும் துறையில், இது குறிப்பிடத்தக்க மாற்றம். இந்த முன்னோடி AI திறனை எப்படி அளவிட வேண்டும் என்ற பெரிய விவாதத்தைத் தீர்க்காது; ஆனால் அது ஒரு அடிப்படை credibility gap-ஐத் தொடுகிறது. ஒரு benchmark, மாடல் என்ன செய்ய முடியும் என்பதைச் சோதிக்கிறதெனில், மாடலுக்கு ஏற்கனவே தேர்வு தெரியக்கூடாது.
இந்தக் கட்டுரை The Decoder-இன் செய்திப்படிப்பின் அடிப்படையில் அமைந்தது. அசல் கட்டுரையைப் படிக்கவும்.
Originally published on the-decoder.com


