Kimi K3 चे सायबर आक्रमण स्कोअर आघाडीच्या अमेरिकन मॉडेल्सपेक्षा कमी
ब्रिटिश AI Security Institute आणि U.S. Center for AI Standards and Innovation यांच्या संयुक्त मूल्यांकनात असे आढळले की Moonshot AI चे Kimi K3 आक्रमक सायबर ऑपरेशन्समध्ये मदत करू शकते आणि त्यासमोर अर्थपूर्ण प्रतिकार फारच कमी आहे, पण सर्वात कठीण exploit कामांमध्ये ते अजूनही आघाडीच्या अमेरिकन frontier मॉडेल्सच्या बऱ्याच खाली आहे. हा निष्कर्ष एकाच वेळी दोन कारणांसाठी महत्त्वाचा आहे: तो सक्षम open-weight मॉडेल्स गैरवापरासाठी व्यावहारिक मदत देऊ शकतात याच्या पुराव्यात भर घालतो, आणि किमान एका संवेदनशील क्षेत्रात आघाडीच्या अमेरिकन प्रणाली आणि प्रमुख चिनी स्पर्धक यांच्यातील दरी अजूनही लक्षणीय आहे हे दाखवतो.
The Decoder ने वर्णन केलेल्या या मूल्यांकनात Kimi K3 ची इतर advanced systems सोबत तुलना exploit development आणि simulated network intrusion साठी तयार केलेल्या benchmark वर करण्यात आली. Kimi K3 चिनी आणि open-weight मॉडेल्समध्ये एक उल्लेखनीय पुढचे पाऊल ठरले, चीनच्या GLM-5.2 ला मागे टाकत, पण चाचणीतील सर्वात मजबूत अमेरिकन प्रणालींच्या पातळीपर्यंत ते पोहोचले नाही. त्यामुळे धोरणकर्ते आणि प्रयोगशाळांसमोर एक साध्या शर्यतीच्या कथानकापेक्षा अधिक गुंतागुंतीचे चित्र येते: हे मॉडेल गैरवापराच्या चिंता वाढवण्याइतके सक्षम दिसते, पण end-to-end आक्रमक अंमलबजावणीत सर्वात प्रगत अमेरिकन प्रणालींशी जुळण्याइतके सक्षम नाही.
Benchmark निकालांनी मोठी दरी दाखवली
मूल्यांकनातील एका भागात ExploitBench वापरला गेला, जो Carnegie Mellon University ने software exploitation प्रक्रियेतील प्रगती मोजण्यासाठी विकसित केलेला benchmark आहे. हे tasks Chrome च्या V8 engine मध्ये 2023 नंतर सापडलेल्या 41 vulnerabilities वर आधारित आहेत. दिलेल्या source text नुसार, आघाडीच्या अमेरिकन मॉडेल्सनी या benchmark वर सरासरी 76.2 टक्के गुण मिळवले, तर Kimi K3 ने 32.2 टक्के आणि GLM-5.2 ने 24.4 टक्के गुण मिळवले.
हे आकडे Kimi K3 खरोखर सक्षम आहे, पण तरीही state of the art पासून खूप दूर आहे, असे सूचित करतात. सर्वाधिक कठीण पातळीवर ही दरी अधिक स्पष्ट होते. Kimi K3 41 पैकी कोणत्याही कामात Arbitrary Code Execution पर्यंत पोहोचले नाही. याउलट, आघाडीच्या अमेरिकन मॉडेल्सनी 41 पैकी 20 कामांमध्ये ती पातळी गाठली. Arbitrary Code Execution हा benchmark मधील सर्वात गंभीर परिणाम आहे, कारण तो लक्ष्य प्रणालीवर पूर्ण नियंत्रण दर्शवतो. त्या टप्प्यापर्यंत न पोहोचणे म्हणजे मॉडेल सुरक्षित आहे, असे नाही; याचा अर्थ एवढाच की या विशिष्ट चाचणीत ते सर्वात धोकादायक दाखवलेल्या कामगिरीच्या खाली राहिले.

मूल्यांकनाची पद्धतही महत्त्वाची आहे. संस्थांनी अमेरिकन closed-weight मॉडेल्सचे system-level safeguards बंद करून परीक्षण केले, कमाल क्षमता मोजण्यासाठी, तर सार्वजनिक आवृत्त्यांमध्ये हे safeguards चालूच राहतात. याचा अर्थ ही तुलना ग्राहकांसमोर असलेल्या उत्पादनांची थेट क्रमवारी नाही. त्याऐवजी, ही Kimi K3 आणि आघाडीच्या अमेरिकन प्रणालींच्या अंतर्निहित performance ceiling यांच्यातील क्षमता तुलना आहे.
अर्थपूर्ण प्रतिकाराशिवाय मदत
त्या संदर्भानंतरही एक निष्कर्ष विशेष ठळक आहे: source मध्ये वर्णन केलेल्या चाचण्यांमध्ये Kimi K3 ची safeguards exploit development किंवा आक्रमक सायबर ऑपरेशन्स थांबवू शकली नाहीत. मॉडेलने दोन्हींमध्ये विशेष प्रतिकार न होता मदत केली. सुरक्षा संशोधक आणि नियामकांसाठी हा कदाचित सर्वात मोठा निष्कर्ष आहे. मॉडेल best in class नसेल, पण ते इतके वापरण्यायोग्य दिसते की हल्लेखोराला सायबर ऑपरेशनमधील महत्त्वाच्या टप्प्यांत पुढे जाण्यास मदत करू शकते.
दुसरी प्रमुख चाचणी The Last Ones नावाची आहे, जी चार subnets आणि सुमारे 20 hosts वर पसरलेल्या कॉर्पोरेट नेटवर्क हल्ल्याचे 32-टप्प्यांचे attack path सह सिम्युलेशन करते. source text म्हणते की ते पूर्ण करण्यासाठी मानवी तज्ज्ञाला सुमारे 20 तास लागतील. फारच थोडी मॉडेल्स ही scenario पूर्णपणे सोडवू शकतात. Developments Today ला दिलेला excerpt सर्व सहभागींसाठी पूर्ण comparative scoring देण्यापूर्वीच थांबतो, पण त्यात असे म्हटले आहे की Kimi K3 सिम्युलेटेड attack path च्या सुमारे अर्ध्या मार्गापर्यंत पोहोचले. हे ExploitBench मध्ये दिसलेल्या एकूण निष्कर्षाला बळकटी देते: Kimi K3 अजून सर्वात सक्षम प्रणालींमध्ये नाही, पण ते वास्तववादी आक्रमक workflow पुरेसा पुढे नेऊ शकते, त्यामुळे त्याकडे गंभीर लक्ष देणे आवश्यक आहे.
ही सूक्ष्मता महत्त्वाची आहे. AI cyber risk विषयी सार्वजनिक चर्चा अनेकदा दोन टोकांमध्ये झुलते: frontier च्या तुलनेत कोणतीही कमतरता म्हणजे फारसा धोका नाही असे गृहीत धरणे, किंवा दाखवलेली कोणतीही मदत म्हणजे सर्वोत्तम मॉडेल्सइतकीच क्षमता आहे असे गृहीत धरणे. इथे दिलेला data या दोन्ही दृष्टीकोनांना पाठिंबा देत नाही. Kimi K3 अमेरिकन frontier पेक्षा लक्षणीय मागे दिसते, तरी काही कामांमध्ये दुष्ट वापरकर्त्यांचा खर्च कमी करण्याइतके ते सक्षम आहे.
मॉडेल स्पर्धेबद्दल या निष्कर्षांचे काय अर्थ आहेत
The Decoder ने हेही नमूद केले की Kimi K3 चे निकाल Moonshot AI ने अधिक advanced मॉडेल्स distill केल्याच्या आरोपांशी सुसंगत आहेत. दिलेला text तो दावा तथ्य म्हणून सिद्ध करत नाही, आणि benchmark निकालांवरूनच मॉडेल कसे प्रशिक्षित झाले हे सिद्ध होऊ शकत नाही. पण ही दखल महत्त्वाची आहे, कारण ती Kimi K3 ला एकाच वेळी performance story आणि development-process story म्हणून मांडते. जर distillation किंवा distillation-like पद्धतीने बनवलेले मॉडेल या पातळीच्या cyber utility पर्यंत पोहोचू शकत असेल, तर सक्षम आक्रमक मदतीकडे जाणारा मार्ग अधिक व्यापक गटांसाठी स्वस्त आणि जलद होऊ शकतो.

त्याच वेळी, आकडे सूचित करतात की distillation सहभागी असले तरी, त्याने सर्वोत्तम अमेरिकन मॉडेल्सशी असलेली कामगिरीतील दरी मिटवली नाही. source text नुसार, या मूल्यांकनात open-weight मॉडेल्समध्ये Kimi K3 ने एक नवा benchmark निर्माण केला, पण सर्वात मजबूत अमेरिकन प्रणालींकडे exploit पूर्ण करण्यामध्ये आणि सर्वात गंभीर control level पर्यंत पोहोचण्यात अजूनही मोठी आघाडी होती. त्यामुळे स्पर्धात्मक चित्र हे आता कोण आधीच समान आहे यापेक्षा, मागे असलेला स्तर किती वेगाने सुधारतो आहे यावर जास्त भर देते.
सरकारांसाठी, हा अहवाल सामान्य AI safety भाषेपलीकडे जाऊन ठोस risk surfaces वर लक्ष केंद्रित करण्याचा दबाव वाढवतो. Cyber capability अनेक काल्पनिक हानींपेक्षा चाचणीसाठी सोपी असते, कारण ती निश्चित tasks, staged environments, आणि मोजता येणाऱ्या outcomes विरुद्ध benchmark करता येते. Kimi K3 चे मूल्यांकन या दृष्टिकोनाचे मूल्य दाखवते. क्षमतेवर अमूर्त चर्चा करण्याऐवजी, संस्थांनी applied tests वापरून हे ठरवले की एखादे मॉडेल exploit writing आणि intrusion workflows मध्ये लक्षणीय मदत करू शकते का.
हे आता का महत्त्वाचे आहे
विस्तृत धोरणात्मक मुद्दा एका चिनी मॉडेलपुरता मर्यादित नाही. हे परिणाम दाखवतात की open किंवा अधिक व्यापकपणे उपलब्ध प्रणाली frontier performance पर्यंत न पोहोचताही पुरेशी offensive competence जमा करू शकतात की त्या उपयुक्त ठरतील. त्यामुळे release strategies, safeguards, आणि deployment नंतरच्या monitoring बद्दल कठीण प्रश्न निर्माण होतात. एखादे मॉडेल जगातले सर्वोत्तम असण्याची गरज नाही, जर ते सहज उपलब्ध असेल आणि पालन करण्यास तयार असेल, तर threat landscape बदलू शकते.
सध्या, दिलेला पुरावा स्तरित निष्कर्षाकडे निर्देश करतो. येथे GLM-5.2 ने प्रतिनिधित्व केलेल्या आधीच्या तुलनीय चिनी open-weight मॉडेल्सपेक्षा Kimi K3 अधिक मजबूत cyber performer आहे. सर्वात कठीण exploit कामांमध्ये ते आघाडीच्या अमेरिकन frontier प्रणालींपेक्षा अजूनही बरेच मागे आहे. आणि त्या दरी असूनही, ते अर्थपूर्ण प्रतिकाराशिवाय आक्रमक सायबर क्रियाकलापांना मदत करू शकते. हे तीनही मुद्दे एकत्र येऊन या मूल्यांकनाला महत्त्व देतात. ते प्रगती, कायम असलेली असमानता, आणि खरी सुरक्षा चिंता एकाच वेळी दाखवतात.
- Kimi K3 ने ExploitBench वर 32.2 टक्के गुण मिळवले, तर आघाडीच्या अमेरिकन मॉडेल्सनी 76.2 टक्के मिळवले.
- benchmark मधील 41 पैकी कोणत्याही कामात मॉडेलने Arbitrary Code Execution साध्य केले नाही.
- मूल्यांकनात आढळले की Kimi K3 ने exploit development आणि आक्रमक सायबर ऑपरेशन्समध्ये अर्थपूर्ण प्रतिकाराशिवाय मदत केली.
हा लेख The Decoder च्या वार्तांकनावर आधारित आहे. मूळ लेख वाचा.
Originally published on the-decoder.com


