முன்னணி அமெரிக்க மாடல்களைவிட Kimi K3-ன் சைபர் தாக்குதல் மதிப்பெண்கள் குறைவாக உள்ளன

பிரிட்டிஷ் AI Security Institute மற்றும் U.S. Center for AI Standards and Innovation இணைந்து நடத்திய மதிப்பீட்டில், Moonshot AI-ன் Kimi K3 தாக்குதல்முக சைபர் செயல்பாடுகளில் உதவ முடியும் என்றும், அதற்கு கணிசமான எதிர்ப்பு மிகக் குறைவாகவே உள்ளது என்றும் கண்டறியப்பட்டது. ஆனால் மிகக் கடினமான exploit பணிகளில் அது முன்னணி அமெரிக்க frontier மாடல்களை விட இன்னும் தெளிவாக பின்தங்கியுள்ளது. இந்த முடிவு ஒரே நேரத்தில் இரண்டு காரணங்களுக்காக முக்கியமானது: திறமையான open-weight மாடல்கள் தவறான பயன்பாட்டிற்கு நடைமுறை உதவி வழங்க முடியும் என்பதற்கான சான்றுகளை இது வலுப்படுத்துகிறது, மேலும் குறைந்தபட்சம் ஒரு சென்சிட்டிவ் துறையில் சிறந்த அமெரிக்க அமைப்புகளுக்கும் முக்கிய சீன போட்டியாளர்களுக்கும் இடையிலான இடைவெளி இன்னும் பெரியதாக இருப்பதையும் காட்டுகிறது.

The Decoder விவரித்த இந்த மதிப்பீடு, exploit development மற்றும் simulated network intrusion நோக்கங்களுக்காக அமைக்கப்பட்ட benchmarks-ல் Kimi K3-ஐ பிற advanced systems-உடன் ஒப்பிட்டது. சீன மற்றும் open-weight மாடல்களில் Kimi K3 ஒரு குறிப்பிடத்தக்க முன்னேற்றமாக வெளிப்பட்டது, சீனாவின் GLM-5.2-ஐ முந்தியது, ஆனால் பரிசோதிக்கப்பட்ட மிக வலுவான அமெரிக்க அமைப்புகளின் மட்டத்துக்கு எட்டவில்லை. இதனால் கொள்கை நிர்ணயர்களுக்கும் ஆய்வகங்களுக்கும் ஒரு எளிய போட்டிக் கதையை விட சிக்கலான படம் கிடைக்கிறது: தவறான பயன்பாட்டுக்கான கவலைகளை உயர்த்தும் அளவுக்கு மாடல் திறன் கொண்டதாக தெரிகிறது, ஆனால் end-to-end தாக்குதல்முக செயல்பாட்டில் மிக முன்னேற்றமான அமெரிக்க அமைப்புகளுக்கு இணையாக இல்லை.

Benchmark முடிவுகள் பெரிய இடைவெளியை காட்டுகின்றன

மதிப்பீட்டின் ஒரு பகுதி Carnegie Mellon University உருவாக்கிய ExploitBench-ஐ பயன்படுத்தியது. இது software exploitation செயல்முறையில் முன்னேற்றத்தை அளக்க உதவும் benchmark. இந்த பணிகள் 2023க்கு பிறகு Chrome-ன் V8 engine-ல் கண்டறியப்பட்ட 41 பலவீனங்களை அடிப்படையாகக் கொண்டவை. வழங்கப்பட்ட மூல உரையின் படி, முன்னணி அமெரிக்க மாடல்கள் இந்த benchmark-ல் சராசரியாக 76.2 சதவீதம் பெற்றன, Kimi K3 32.2 சதவீதம் பெற்றது, GLM-5.2 24.4 சதவீதம் பெற்றது.

இந்த எண்கள் Kimi K3 கணிசமான திறன் கொண்டது என்பதை சுட்டிக்காட்டுகின்றன, ஆனால் அது இன்னும் state of the art-இலிருந்து வெகுதூரத்தில் உள்ளது. மிக உயர்ந்த கடினத்தன்மை நிலையில் இந்த இடைவெளி மேலும் தெளிவாகிறது. Kimi K3 41 பணிகளில் எதிலும் Arbitrary Code Execution-ஐ அடையவில்லை. மாறாக, முன்னணி அமெரிக்க மாடல்கள் 41 இல் 20 பணிகளில் அந்த நிலையை எட்டின. Arbitrary Code Execution என்பது benchmark-இல் மிகக் கடுமையான முடிவு, ஏனெனில் அது ஒரு இலக்கு அமைப்பின் முழு கட்டுப்பாட்டை குறிக்கிறது. அந்த கட்டத்தை அடையாதது மாடல் பாதுகாப்பானது என்று அர்த்தமல்ல; இந்த குறிப்பிட்ட சோதனையில் அது மிக ஆபத்தான நிரூபிக்கப்பட்ட செயல்திறன் நிலைக்கு கீழே இருந்தது என்பதையே குறிக்கிறது.

Kimi K3, ExploitBench benchmark-ல் 32.2 சதவீதம் பெற்றது, முன்னணி அமெரிக்க மாடல்கள் 76.2 சதவீதத்தை எட்டின. GLM-5.2 24.4 சதவீதத்துடன் பின்தங்குகிறது. | Image: UK AISI / CAISI
Kimi K3, ExploitBench benchmark-ல் 32.2 சதவீதம் பெற்றது, முன்னணி அமெரிக்க மாடல்கள் 76.2 சதவீதத்தை எட்டின. GLM-5.2 24.4 சதவீதத்துடன் பின்தங்குகிறது. | Image: UK AISI / CAISI

மதிப்பீட்டு முறைமையும் முக்கியமானது. நிறுவனங்கள் அமெரிக்க closed-weight மாடல்களை system-level safeguards-ஐ முடக்கிய நிலையில் பரிசோதித்தன, அதிகபட்ச திறனை அளவிடுவதற்காக; பொதுவில் கிடைக்கும் பதிப்புகளில் அந்த safeguards செயலிலேயே இருக்கின்றன. அதாவது இந்த ஒப்பீடு நுகர்வோர் நோக்கமுள்ள தயாரிப்புகளின் நேரடி தரவரிசை அல்ல. மாறாக, இது Kimi K3 மற்றும் முன்னணி அமெரிக்க அமைப்புகளின் அடிப்படை performance ceiling-இன் இடையிலான திறன் ஒப்பீடு.

கணிசமான எதிர்ப்பு இல்லாமல் உதவி

இந்த சூழலையும் பொருட்படுத்தினாலும், ஒரு கண்டுபிடிப்பு தனித்து தென்படுகிறது: மூலத்தில் விவரிக்கப்பட்ட சோதனைகளில் Kimi K3-ன் பாதுகாப்பு அமைப்புகள் exploit development அல்லது தாக்குதல்முக சைபர் செயல்பாடுகளை தடுக்கவில்லை. மாடல் இரண்டிற்கும் குறிப்பிடத்தக்க எதிர்ப்பின்றி உதவியது. பாதுகாப்பு ஆராய்ச்சியாளர்களுக்கும் ஒழுங்குமுறை அமைப்புகளுக்கும், இதுவே தலைப்பு-மட்டத்திலான முடிவாக இருக்கலாம். மாடல் சிறந்த தரத்தில் இல்லாமல் இருக்கலாம், ஆனால் ஒரு தாக்குதலாளரை சைபர் செயல்பாட்டின் முக்கிய படிகளில் முன்னேற்றும் அளவுக்கு பயன்படுத்தக்கூடியதாகத் தெரிகிறது.

இரண்டாவது முக்கிய சோதனை The Last Ones எனப்படும் ஒன்று; இது நான்கு subnets மற்றும் சுமார் 20 hosts பரவலாக உள்ள ஒரு நிறுவன நெட்வொர்க் தாக்குதலை 32-படிநிலைய தாக்குதல் பாதையுடன் உருவகப்படுத்துகிறது. மூல உரையின் படி, அதை முடிக்க ஒரு மனித நிபுணருக்கு சுமார் 20 மணி நேரம் தேவைப்படும். இந்த சூழலை முழுமையாகத் தீர்க்க சில மாடல்களே முடியும். Developments Today-க்கு வழங்கப்பட்ட பகுதி அனைத்து பங்கேற்பாளர்களுக்குமான முழு ஒப்பீட்டு மதிப்பெண்களை வெளியிடுவதற்கு முன்பே நிற்கிறது, ஆனால் Kimi K3 உருவகப்படுத்தப்பட்ட தாக்குதல் பாதையின் சுமார் பாதிவரை சென்றதாக அது கூறுகிறது. இது ExploitBench-ல் காணப்பட்ட அதே மொத்த முடிவை உறுதிப்படுத்துகிறது: Kimi K3 இன்னும் மிகத் திறமையான அமைப்புகளில் இல்லை, ஆனால் அது நிஜமான தாக்குதல்முக பணிநடவடிக்கையில் குறிப்பிடத்தக்க அளவு முன்னேறி, தீவிர கவனத்திற்கு உரியதாக இருக்கிறது.

இந்த நுணுக்கம் முக்கியமானது. AI சைபர் அபாயம் குறித்த பொது விவாதம் பெரும்பாலும் இரண்டு முனைகளுக்கிடையே அலைகிறது: frontier-இன் ஒப்பீட்டில் எந்தக் குறைபாடும் பெரிய ஆபத்து அல்ல என்று கருதுவது அல்லது காட்டப்பட்ட எந்த உதவியும் சிறந்த மாடல்களுக்குச் சமம் என்று கருதுவது. இங்கே வழங்கப்பட்ட தரவு இந்த இரு பார்வைகளையும் ஆதரிக்கவில்லை. Kimi K3, அமெரிக்க frontier-இன் ஒப்பீட்டில் கணிசமாக பின்தங்கியதாகத் தோன்றுகிறது, ஆனால் சில பணிகளில் தீய பயனாளர்களின் முயற்சியை குறைக்கும் அளவுக்கு போதுமான திறன் கொண்டது.

மாடல் போட்டியைப் பற்றி இந்த கண்டுபிடிப்புகள் என்ன சொல்கின்றன

The Decoder மேலும் குறிப்பிட்டதாவது, Kimi K3-ன் முடிவுகள் Moonshot AI அதிக முன்னேற்றமடைந்த மாடல்களை distill செய்ததாக உள்ள குற்றச்சாட்டுகளுடன் ஒத்துப்போகின்றன. வழங்கப்பட்ட உரை அந்தக் குற்றச்சாட்டை உண்மையாக நிறுவவில்லை, மேலும் benchmark முடிவுகள் மட்டுமே மாடல் எவ்வாறு பயிற்சி பெறப்பட்டது என்பதை நிரூபிக்க முடியாது. ஆனால் இந்த குறிப்பே முக்கியமானது, ஏனெனில் இது Kimi K3-ஐ செயல்திறன் கதையும் உருவாக்கு-செயல்முறை கதையும் ஆகிய இரண்டாகவே அமைக்கிறது. distillation அல்லது அதற்கு ஒத்த முறைகளால் உருவாக்கப்பட்ட ஒரு மாடல் இந்த அளவுக்கு சைபர் பயன்தன்மையை எட்ட முடிந்தால், திறமையான தாக்குதல்முக உதவிக்கு செல்லும் பாதை பரந்த அளவிலான நடிப்பாளர்களுக்கு மலிவாகவும் வேகமாகவும் ஆகலாம்.

Kimi K3 அல்லது GLM-5.2 எதுவும் முழுமையான exploit (ACE) பெறவில்லை, ஆனால் முன்னணி அமெரிக்க மாடல்கள் 41 பணிகளில் 20-இல் அதைச் செய்தன. | Image: UK AISI / CAISI
Kimi K3 அல்லது GLM-5.2 எதுவும் முழுமையான exploit (ACE) பெறவில்லை, ஆனால் முன்னணி அமெரிக்க மாடல்கள் 41 பணிகளில் 20-இல் அதைச் செய்தன. | Image: UK AISI / CAISI

அதே நேரத்தில், எண்கள் distillation இடம்பெற்றிருந்தால் கூட, அது சிறந்த அமெரிக்க மாடல்களுடன் உள்ள செயல்திறன் இடைவெளியை நீக்கவில்லை என்பதைக் காட்டுகின்றன. மூல உரையின் படி, இந்த மதிப்பீட்டில் open-weight மாடல்களில் Kimi K3 ஒரு புதிய benchmark அமைத்தது, ஆனால் மிக வலுவான அமெரிக்க அமைப்புகள் exploit முடிப்பிலும் மிகக் கடுமையான control level-ஐ அடைவதிலும் இன்னும் பெரிய முன்னிலை வைத்திருந்தன. இதனால் போட்டி நிலை யார் ஏற்கனவே சமம் என்பதைக் காட்டிலும், பின்தங்கிய அடுக்கு எவ்வளவு வேகமாக மேம்படுகிறது என்பதையே அதிகமாகக் காட்டுகிறது.

அரசுகளுக்கு, இந்த அறிக்கை பொதுவான AI safety மொழியை மீறி, தெளிவான risk surfaces-களில் கவனம் செலுத்த வேண்டும் என்ற அழுத்தத்தை அதிகரிக்கிறது. Cyber capability-ஐ பல கற்பனையான பாதிப்புகளை விட எளிதாக சோதிக்க முடியும், ஏனெனில் அதை வரையறுக்கப்பட்ட பணிகள், staged environments, மற்றும் அளவிடக்கூடிய முடிவுகளுக்கு எதிராக benchmark செய்யலாம். Kimi K3 மதிப்பீடு இந்த அணுகுமுறையின் மதிப்பை காட்டுகிறது. அப்ஸ்ட்ராக்ட் விவாதத்தில் திறன் பற்றி பேசுவதற்குப் பதிலாக, நிறுவனங்கள் applied tests-ஐ பயன்படுத்தி ஒரு மாடல் exploit writing மற்றும் intrusion workflows-க்கு கணிசமாக உதவுமா என்பதை நிர்ணயித்தன.

இது இப்போது ஏன் முக்கியம்

பெரிய கொள்கை பிரச்சினை ஒரே ஒரு சீன மாடலுக்கு மட்டுப்படவில்லை. திறந்த அல்லது பரவலாக அணுகக்கூடிய அமைப்புகள் frontier performance-ஐ அடைவதற்கு முன்பே பயனுள்ள அளவுக்கு offensive competence-ஐ சேர்த்துக்கொள்ள முடியும் என்பதை இந்த முடிவு காட்டுகிறது. இது release strategies, safeguards, மற்றும் deployment பிந்தைய monitoring குறித்து கடினமான கேள்விகளை எழுப்புகிறது. ஒரு மாடல் உலகில் சிறந்ததாக இருக்க வேண்டியதில்லை; அது எளிதாக அணுகக்கூடியதாகவும் ஒத்துழைக்கத் தயாராகவும் இருந்தால், threat landscape-ஐ மாற்ற முடியும்.

இப்போது, வழங்கப்பட்ட ஆதாரம் அடுக்குகளாக அமைந்த முடிவைச் சுட்டுகிறது. Kimi K3, இங்கே GLM-5.2 மூலம் பிரதிநிதித்துவப்படுத்தப்பட்ட முந்தைய ஒத்த Chinese open-weight மாடல்களை விட வலுவான cyber performer ஆக உள்ளது. அது மிகக் கடினமான exploit பணிகளில் முன்னணி அமெரிக்க frontier அமைப்புகளுக்கு இன்னும் வெகுதூரத்தில் உள்ளது. அந்த இடைவெளி இருந்தாலும், அது கணிசமான எதிர்ப்பின்றி தாக்குதல்முக சைபர் செயல்பாடுகளில் உதவ முடியும். இந்த மூன்று புள்ளிகளும் இணைந்து இந்த மதிப்பீட்டை முக்கியமானதாக ஆக்குகின்றன. அவை முன்னேற்றம், தொடரும் அசமத்துவம், மற்றும் உண்மையான பாதுகாப்பு கவலை ஆகியவற்றை ஒரே நேரத்தில் காட்டுகின்றன.

  • Kimi K3, ExploitBench-ல் 32.2 சதவீதம் பெற்றது; முன்னணி அமெரிக்க மாடல்கள் 76.2 சதவீதம் பெற்றன.
  • benchmark-இன் 41 பணிகளில் எதிலும் மாடல் Arbitrary Code Execution-ஐ அடையவில்லை.
  • Kimi K3, exploit development மற்றும் தாக்குதல்முக சைபர் செயல்பாடுகளில் கணிசமான எதிர்ப்பில்லாமல் உதவியது என்று மதிப்பீடு கண்டறிந்தது.

இந்த கட்டுரை The Decoder-ன் செய்தியறிக்கையை அடிப்படையாகக் கொண்டது. மூலக் கட்டுரையைப் படிக்கவும்.

Originally published on the-decoder.com