AI மாதிரி சோதனையை முறையாக்க NIST நகர்வு
அமெரிக்க தேசிய தரநிலைகள் மற்றும் தொழில்நுட்ப நிறுவனம், மாதிரி செயல்திறன் மற்றும் பாதுகாப்பை சோதிப்பதற்கான மேலும் கட்டமைக்கப்பட்ட வழியை ஆராய்ச்சியாளர்கள் மற்றும் உருவாக்குநர்களுக்கு வழங்கும் நோக்குடன், ஒரு புதிய செயற்கை நுண்ணறிவு மதிப்பீட்டு தளத்தை அறிமுகப்படுத்தியுள்ளது. AI Technology Evaluation, அல்லது AITE, எனப்படும் இந்த திட்டம் ஜூலை 27 அன்று அறிவிக்கப்பட்டது, மேலும் இது குருட்டு தரவைப் பயன்படுத்தி தனிமைப்படுத்தப்பட்ட சூழலில் மாதிரிகள் மதிப்பீடு செய்யப்படும் ஒரு விருப்ப சோதனை அமைப்பாக வடிவமைக்கப்பட்டுள்ளது.
இந்த முயற்சி முக்கியமானது, ஏனெனில் இது AI நிர்வாகம் மற்றும் பயன்பாட்டில் வளர்ந்து வரும் ஒரு பிரச்சினையைச் சமாளிக்கிறது: மாதிரி திறனைப் பற்றிய பல கூற்றுகளை வெவ்வேறு ஆய்வகங்கள், விற்பனையாளர்கள், மற்றும் பயன்பாட்டு வழக்குகளுக்கு இடையில் ஒப்பிடுவது கடினம். benchmark inflation, சீரற்ற சோதனை நிலைகள், மற்றும் பயிற்சி வழித்தடங்களில் ஏற்கனவே சேர்க்கப்பட்டிருக்கக் கூடிய பொதுத் தரவுத்தொகுப்புகளின் பயன்பாடு, தலைப்பு சார்ந்த செயல்திறன் எண்களை அவை தோன்றுவதற்கும் குறைவான அர்த்தமுள்ளதாக மாற்றலாம்.
AITE ஒரு அதிக கட்டுப்பாட்டுடன் கூடிய மாற்றை வழங்க உருவாக்கப்பட்டுள்ளது. மூல உரையின் படி, இந்த தளம் பொதுவான தரவு, அளவுகோல்கள், மற்றும் மதிப்பெண் வழங்கலை அளித்து, உருவாக்குநர்கள் தங்கள் அமைப்புகள் எப்படி செயல்படுகின்றன என்பதை சிறப்பாகப் புரிந்துகொள்ள உதவும். தளத்தின் மூலம் வழங்கப்படும் சோதனைத் தரவு பயிற்சி தரவாக மாற வேண்டியதல்ல; மதிப்பீடுகளை சுயாதீனமாக வைத்திருக்க இது ஒரு முக்கியமான வடிவமைப்பு தேர்வு.
AITE எதற்காக அமைக்கப்பட்டுள்ளது
NIST இந்த அமைப்பை ஒரு தனிமைப்படுத்தப்பட்ட testbed என விவரிக்கிறது, இதில் AI மாதிரிகள் குருட்டு தரவை செயலாக்கும்போது பல்வேறு கட்டளைகளுக்கு எதிராக மதிப்பீடு செய்யப்படலாம். அந்த அமைப்பு திறன் மற்றும் பாதுகாப்பு தொடர்பான நடத்தை இரண்டிலும் பொருத்தமான, நோக்குநிலைத் தரவுகளை உருவாக்குவதே நோக்கம். பரவலாகப் புழங்கும் திறந்த benchmark-களில் மட்டுமே சார்ந்திருக்காமல், இந்த தளம் பொதுமக்களுக்கு கிடைக்காத தரவுத்தொகுப்புகளைப் பயன்படுத்துகிறது.
இதன் நடைமுறை விளைவு நேரடியானது: மாதிரிகள் அவர்கள் ஏற்கனவே பார்த்திருக்கக்கூடிய பொருட்களின் அடிப்படையில் மதிப்பீடு செய்யப்பட வாய்ப்பு குறைகிறது, மேலும் முடிவுகளை ஒப்பிட ஆராய்ச்சியாளர்களுக்கு அதிக நம்பகமான அடித்தளம் கிடைக்கிறது. AI மதிப்பீட்டில் இது ஒரு பொருத்தமான வேறுபாடு. ஒரு benchmark மிகவும் பயனுள்ளதாக இருப்பது, அது மாதிரி உண்மையாகவே அறிமுகமில்லாத பணிகளை எப்படிக் கையாளுகிறது என்பதை வெளிப்படுத்தும்போது தான்; அதன் எடைகளில் ஏற்கனவே பதிந்திருக்கக்கூடிய தரவு வடிவங்களை எவ்வளவு நன்றாக மீளுருவாக்குகிறது என்பதல்ல.
AITE தொடக்கத்தில் பெரிய vision-language மாதிரிகளுக்கான image-analysis பணிகளுடன் தொடங்கும்; மூன்று துறைகள்: quantum science, genomics, மற்றும் public safety. பின்னர் மேலும் பணிகள் சேர்க்கப்படும் என NIST கூறுகிறது. தொடக்க கவனம் ஒரு நடைமுறைத் தேர்வை பிரதிபலிக்கிறது. vision-language அமைப்புகள் வணிக மற்றும் அரசு சூழல்களில் இரண்டிலும் அதிக முக்கியத்துவம் பெறுகின்றன, ஆனால் துறை-சார் செயல்திறனுக்கான மதிப்பீட்டு தரநிலைகள் இன்னும் சீரற்றவையாக உள்ளன.
குருட்டு தரவு ஏன் உரையாடலை மாற்றுகிறது
இந்த தளத்தின் மிக முக்கியமான அம்சமாக அதன் குருட்டு தரவுத்தொகுப்புகளின் பயன்பாடு இருக்கலாம். AI-யில், பொதுத் benchmarks தரநிலைப்படுத்தலுக்கு உதவுகின்றன, ஆனால் அவை சோதனைக்கு நேரடியாக மேம்படுத்துவதற்கான ஊக்கங்களையும் உருவாக்குகின்றன. இது உண்மையான பொதுமைப்படுத்தல் மற்றும் benchmark-சார்ந்த fine-tuning ஆகியவற்றுக்கிடையிலான வேறுபாட்டை மங்கச் செய்யலாம். பொதுமக்களுக்கு கிடைக்காத அசல் தரவுத்தொகுப்புகளைப் பயன்படுத்துவதன் மூலம், AITE அந்த சிதைவை குறைக்க நோக்குகிறது.
திட்டத்தில் பங்கேற்கும் தரவு வழங்குநர்கள், அந்தத் தரவுத்தொகுப்புகளுக்கு ஏற்ற அர்த்தமுள்ள பணிகளுடன் அசல், பொதுவல்லாத தரவுத்தொகுப்புகளை சமர்ப்பிப்பார்கள் என்று எதிர்பார்க்கப்படுகிறது. அதற்குப் பதிலாக, மாதிரி உருவாக்குநர்கள் தங்கள் மாதிரிகளை அந்தப் பொருட்களில் சோதனைக்காக சமர்ப்பிக்கின்றனர். NIST-இன் பங்கு சோதனை உட்கட்டமைப்பையும் பொதுவான மதிப்பெண் கட்டமைப்பையும் வழங்குவதாகும்.
இந்த அமைப்பிற்கு இரண்டு விளைவுகள் உள்ளன. முதலாவது, தரவு உரிமையாளர்கள் தங்கள் துறை-சார்ந்த மதிப்பீட்டு உள்ளடக்கத்தை பொதுப் பயிற்சி வளமாக மாற்றாமல் பங்களிக்க ஒரு வழியை இது வழங்குகிறது. இரண்டாவது, மாதிரி உருவாக்குநர்கள் மூன்றாம் தரப்பு செயல்திறன் சிக்னல்களைப் பெற ஒரு வழியை இது வழங்குகிறது; அவை தாமாக அறிவிக்கும் benchmark முடிவுகளைவிட அதிக நம்பகத்தன்மை கொண்டிருக்கலாம்.
இதன் பொருள் AITE AI மதிப்பீட்டிற்கான ஒரே தீர்வு என்று இல்லை. பல விஷயங்கள் தரவுத்தொகுப்பு தரம், பணி வடிவமைப்பு, மற்றும் தேர்ந்தெடுக்கப்பட்ட மதிப்பெண் முறைகள் நடைமுறையில் முக்கியமான தோல்வி வகைகளை பிரதிபலிக்கிறதா என்பதில் சார்ந்திருக்கிறது. ஆனால் ஒரு கட்டமைப்பாக, இது மதிப்பீட்டை மேலும் நிஜமான மற்றும் கடினமான சோதனை நிலைகளுக்கு தள்ளுகிறது.
விருப்ப AI பாதுகாப்பு உட்கட்டமைப்பில் கூட்டாட்சி பங்கு
இந்த அறிமுகம் பெரிய AI உருவாக்குநர்களுடன் விருப்ப ஒத்துழைப்பை மையமாகக் கொண்ட விரிவான கூட்டாட்சி மூலோபாயத்துக்கும் பொருந்துகிறது. மூல உரை AITE-ஐ, விருப்ப மாதிரி சமர்ப்பிப்புகள் மூலம் மாதிரி பாதுகாப்பை முன்னேற்றும் Trump நிர்வாக அணுகுமுறையின் சமீபத்திய கட்டமாக விவரிக்கிறது. இது மே மாத Commerce Department அறிவிப்பைத் தொடர்ந்து வருகிறது; அதில் Google DeepMind, Microsoft, மற்றும் xAI ஆகியவற்றை Center for AI Standards and Innovation வழியாக மாதிரிகளை மதிப்பீடு செய்யும் மறுபேச்சுவார்த்தை செய்யப்பட்ட ஒப்பந்தத்தில் சேர்த்தது.
அந்த சூழல் முக்கியமானது. அமெரிக்க அரசு வெறும் பக்கத்தில் இருந்து வழிகாட்டுதலை வெளியிடுவது மட்டுமல்ல; மாதிரி தரம் மற்றும் பாதுகாப்பு எவ்வாறு அளவிடப்பட வேண்டும் என்பதை வடிவமைக்க intended shared testing உட்கட்டமைப்பை உருவாக்குகிறது. விருப்ப திட்டங்கள், குறிப்பாக மாதிரி கட்டமைப்புகள் மற்றும் பயன்பாட்டு முறைகள் வேகமாக மாறும் துறையில், அதிகாரபூர்வ ஒழுங்குமுறையை விட வேகமாக நகர முடியும். அதே சமயம், அவற்றின் தாக்கம் முன்னணி உருவாக்குநர்கள் பங்கேற்கிறார்களா மற்றும் கிடைக்கும் மதிப்பீடுகள் பரந்த சூழலால் நம்பகமானவையாக ஏற்றுக்கொள்ளப்படுகிறதா என்பதையே சார்ந்துள்ளது.
NIST-இன் நிறுவனப் பங்கு இந்த முயற்சிக்கு கூடுதல் எடை தருகிறது. தொழில்நுட்ப துறைகளில் அளவிடல், தரநிலைகள், மற்றும் மதிப்பீட்டு கட்டமைப்புகளில் இந்த நிறுவனம் நீண்ட காலமாக மையமாக இருந்துள்ளது. அந்த மரபை AI-க்கு பயன்படுத்துவது ஒரு தர்க்கபூர்வமான நகர்வு, குறிப்பாக கொள்கை நிர்ணயர்கள், முகமைகள், மற்றும் நிறுவன வாங்குபவர்கள் விளம்பரக் கூற்றுகளைத் தாண்டி அமைப்புகளை ஒப்பிடச் சிறந்த கருவிகளைத் தேடுகின்றனர் என்பதைக் கருத்தில் கொண்டால்.
முதல் கட்டம் என்ன சுட்டுகிறது
தொடக்க துறைகளின் தேர்வு, NIST அருகிலுள்ள கால மதிப்பீட்டு சவாலை எவ்வாறு பார்க்கிறது என்பதைச் சுட்டுகிறது. quantum science மற்றும் genomics இரண்டும் சிறப்பு அறிவும் சிக்கலான தரவு விளக்கமும் தேவைப்படுவதால், vision-language மாதிரிகள் நிபுணர் சூழல்களில் நம்பகமாக செயல்படுகிறதா என்பதைச் சோதிக்க அவை பயனுள்ள உதாரணங்கள். public safety மேலும் செயல்பாட்டு பரிமாணத்தை சேர்க்கிறது; இங்கே தவறுகள் உடனடி விளைவுகளை ஏற்படுத்தக்கூடும்.
அங்கு தொடங்குவதன் மூலம், AITE தன்னை ஒரு பொதுவான benchmark மையமாக மட்டும் அல்லாமல், பணி-சார்ந்த, அதிக-பங்கு மதிப்பீட்டிற்கான இடமாகவும் நிலைநிறுத்துகிறது போலத் தெரிகிறது. இது அரசாங்க கொள்முதல் மற்றும் ஆராய்ச்சி நிதியளிப்புக்கு முக்கியமானதாக இருக்கலாம், ஏனெனில் முகமைகள் ஒரு மாதிரி கட்டுப்படுத்தப்பட்ட, துறை-சார்ந்த சூழல்களில் செயல்பட முடியும் என்பதற்கான ஆதாரத்தை அதிகமாகத் தேடுகின்றன.
முதல் மதிப்பீடுகள் ஆகஸ்ட் 2026-இல் தொடங்க திட்டமிடப்பட்டுள்ளன, எனவே ஆரம்ப முடிவுகள் விரைவில் வரக்கூடும். அந்த முடிவுகளே AITE ஒரு சிறிய தொழில்நுட்ப திட்டமாக மாறுமா அல்லது அமெரிக்க AI கண்காணிப்பு மற்றும் மாதிரி ஒப்பீட்டில் மேலும் மையக் குறிப்பு புள்ளியாக மாறுமா என்பதை தீர்மானிக்கக்கூடும்.
அடுத்து கவனிக்க வேண்டியது
உடனடி கேள்வி பங்கேற்பு. ஒரு விருப்ப மதிப்பீட்டு கட்டமைப்பு, சமர்ப்பிக்கப்படும் தரவுத்தொகுப்புகளின் தரம் மற்றும் அதைக் கவரும் மாதிரிகளின் தரம் எவ்வளவு நல்லதோ அவ்வளவு மட்டுமே தாக்கம் கொண்டிருக்கும். முன்னணி உருவாக்குநர்கள் குருட்டு பணிகளில் சுயாதீன மதிப்பெண் அளிப்பதில் மதிப்பைக் காண்பார்களானால், AITE வாங்குபவர்கள், ஒழுங்குப்படுத்துநர்கள், மற்றும் ஆராய்ச்சியாளர்களுக்கு முக்கியமான ஒரு சிக்னலாக மாறக்கூடும். பங்கேற்பு குறைந்திருந்தால், அதன் தாக்கம் குறுகியதாகவே இருக்கலாம்.
மற்றொரு கேள்வி விரிவாக்கம். காலப்போக்கில் மேலும் பணிகள் சேர்க்கப்படும் என்று NIST கூறியுள்ளது. தளம் கூடுதல் modalities மற்றும் துறைகளுக்குள் விரிவடைந்தால், மாதிரி செயல்திறன் பற்றி விவாதிக்க மேலும் நிலையான ஒரு பொதுமொழியை உருவாக்க உதவலாம். “state of the art” என்ற சொற்றொடர் அளவிடப்படுவதை விட எளிதாகக் கூறப்படுகிற துறையில் இது குறிப்பாகப் பயனுள்ளதாக இருக்கும்.
இப்போதைக்கு, AITE பரந்த AI-பாதுகாப்பு விவாதத்திலிருந்து செயல்பாட்டு மதிப்பீட்டு உட்கட்டமைப்புக்கான ஒரு தெளிவான மாற்றத்தை பிரதிநிதித்துவப்படுத்துகிறது. benchmarks மற்றும் போட்டியிடும் கூற்றுகளால் நிரம்பிய சந்தையில், NIST இயக்கும் ஒரு குருட்டு-தரவு testbed AI மதிப்பீட்டை மேலும் கடுமையாக்குவதில் முக்கியமான பரிசோதனைகளில் ஒன்றாக மாறக்கூடும்.
இந்த கட்டுரை Defense One வழங்கிய செய்தியறிக்கையை அடிப்படையாகக் கொண்டது. மூலக் கட்டுரையை படிக்கவும்.
Originally published on defenseone.com




