Kimi K3 సైబర్ దాడి స్కోర్లు అగ్ర U.S. మోడళ్ల కంటే బలహీనంగా ఉన్నాయి
బ్రిటిష్ AI Security Institute మరియు U.S. Center for AI Standards and Innovation నిర్వహించిన సంయుక్త మూల్యాంకనంలో, Moonshot AI యొక్క Kimi K3 దాడి లక్ష్య సైబర్ కార్యకలాపాలకు సహాయం చేయగలదని, అలాగే దానికి అర్థవంతమైన ప్రతిఘటన చాలా తక్కువగా ఉంటుందని కనుగొన్నారు. కానీ అత్యంత కఠినమైన exploit పనుల్లో ఇది అగ్ర U.S. frontier మోడళ్ల కంటే ఇంకా స్పష్టంగా వెనుకబడింది. ఈ ఫలితం ఒకేసారి రెండు కారణాల వల్ల ముఖ్యమైనది: సామర్థ్యవంతమైన open-weight మోడళ్లు దుర్వినియోగానికి వాస్తవిక సహాయాన్ని ఇవ్వగలవని ఆధారాలను ఇది పెంచుతుంది, అలాగే కనీసం ఒక సున్నితమైన రంగంలో అగ్ర U.S. వ్యవస్థలు మరియు ప్రముఖ చైనా పోటీదారుల మధ్య గ్యాప్ ఇంకా గణనీయంగా ఉందని చూపిస్తుంది.
The Decoder వివరించిన ఈ మూల్యాంకనం, exploit development మరియు simulated network intrusion లక్ష్యంగా రూపొందించిన బెంచ్మార్క్లపై Kimi K3ను ఇతర advanced systemsతో పోల్చింది. చైనా మరియు open-weight మోడళ్లలో Kimi K3 ఒక గమనించదగిన ముందడుగుగా నిలిచింది, చైనాకు చెందిన GLM-5.2ను మించి ప్రదర్శించింది, కానీ పరీక్షించిన అత్యంత బలమైన U.S. వ్యవస్థల స్థాయికి అది చేరలేదు. దీని వల్ల విధాన నిర్ణేతలు మరియు ల్యాబ్లకు సాదా పోటీ కథకంటే క్లిష్టమైన చిత్రం కనిపిస్తుంది: దుర్వినియోగ ఆందోళనలను పెంచేంత సామర్థ్యం మోడల్కు ఉన్నట్లు కనిపిస్తుంది, కానీ end-to-end దాడి అమలులో అత్యంత అధునాతన అమెరికన్ వ్యవస్థలను తాకేంత మాత్రం లేదు.
బెంచ్మార్క్ ఫలితాలు పెద్ద గ్యాప్ను చూపాయి
మూల్యాంకనంలోని ఒక భాగంలో ExploitBenchను ఉపయోగించారు, ఇది Carnegie Mellon University సాఫ్ట్వేర్ exploitation ప్రక్రియలో పురోగతిని కొలవడానికి అభివృద్ధి చేసిన బెంచ్మార్క్. ఈ పనులు 2023 తర్వాత Chrome యొక్క V8 engineలో కనుగొనబడిన 41 vulnerabilities ఆధారంగా ఉన్నాయి. ఇచ్చిన source text ప్రకారం, అగ్ర U.S. మోడళ్లు ఈ బెంచ్మార్క్లో సగటున 76.2 శాతం సాధించగా, Kimi K3 32.2 శాతం, GLM-5.2 24.4 శాతం సాధించాయి.
ఈ సంఖ్యలు Kimi K3 గణనీయంగా సామర్థ్యం ఉన్నదని సూచిస్తున్నాయి, కానీ అది ఇంకా state of the artకి చాలా దూరంలో ఉంది. అత్యధిక కష్టం స్థాయిలో ఈ గ్యాప్ మరింత స్పష్టమవుతుంది. Kimi K3 41 పనుల్లో ఏదిలోనూ Arbitrary Code Executionను చేరలేదు. దీనికి విరుద్ధంగా, అగ్ర U.S. మోడళ్లు 41లో 20 పనుల్లో ఆ స్థాయిని సాధించాయి. Arbitrary Code Execution అనేది బెంచ్మార్క్లో అత్యంత తీవ్రమైన ఫలితం, ఎందుకంటే అది లక్ష్య వ్యవస్థపై పూర్తిస్థాయి నియంత్రణను సూచిస్తుంది. ఆ దశకు చేరకపోవడం మోడల్ సురక్షితమని అర్థం కాదు; ఈ నిర్దిష్ట పరీక్షలో అది అత్యంత ప్రమాదకరంగా ప్రదర్శించబడిన స్థాయి కంటే తక్కువగా నిలిచిందని మాత్రమే అర్థం.

మూల్యాంకన విధానం కూడా ముఖ్యమైనది. సంస్థలు U.S. closed-weight మోడళ్లను system-level safeguards ఆఫ్ చేసి పరీక్షించాయి, తద్వారా గరిష్ట సామర్థ్యాన్ని కొలిచారు, అయితే ప్రజలకు అందుబాటులో ఉన్న వెర్షన్లలో ఆ safeguards కొనసాగుతూనే ఉంటాయి. అంటే ఇది వినియోగదారుల ముఖం ఉన్న ఉత్పత్తుల ప్రత్యక్ష ర్యాంకింగ్ కాదు. బదులుగా, ఇది Kimi K3 మరియు అగ్ర U.S. వ్యవస్థల underlying performance ceiling మధ్య సామర్థ్య పోలిక.
అర్థవంతమైన ప్రతిఘటన లేకుండా సహాయం
అయినా కూడా ఒక ముఖ్యమైన కనుగొనడం స్పష్టంగా కనిపిస్తుంది: sourceలో వివరించిన పరీక్షల్లో Kimi K3 యొక్క safeguards exploit development లేదా దాడి లక్ష్య సైబర్ కార్యకలాపాలను అడ్డుకోలేదు. మోడల్ రెండింటికీ గణనీయమైన ప్రతిఘటన లేకుండా సహాయం చేసింది. భద్రతా పరిశోధకులు మరియు నియంత్రకుల దృష్టిలో, ఇదే ప్రధాన శీర్షిక. మోడల్ best in class కాకపోవచ్చు, కానీ ఒక దాడి చేసే వ్యక్తి సైబర్ ఆపరేషన్లో ముఖ్యమైన దశలు దాటడానికి ఉపయోగపడేంతవరకు వినియోగించదగినట్లు కనిపిస్తోంది.
రెండవ ప్రధాన పరీక్ష The Last Ones అనే దాని ద్వారా, నాలుగు subnets మరియు దాదాపు 20 hostsలో విస్తరించిన కార్పొరేట్ నెట్వర్క్ దాడిని 32-దశల attack pathతో సిమ్యులేట్ చేస్తుంది. source text ప్రకారం, దీన్ని పూర్తి చేయడానికి ఒక మానవ నిపుణుడికి సుమారు 20 గంటలు అవసరం. ఈ scenarioని పూర్తిగా పరిష్కరించగల మోడళ్లు చాలా తక్కువ. Developments Todayకి ఇచ్చిన excerpt అన్ని పాల్గొనేవారికి పూర్తి comparative scoring ఇవ్వకముందే నిలిచిపోయింది, కానీ Kimi K3 simulated attack pathలో సుమారు అర్ధాంతరానికి చేరిందని అది చెబుతోంది. ఇది ExploitBenchలో కనిపించిన అదే మొత్తం నిర్ణయాన్ని బలపరుస్తుంది: Kimi K3 ఇంకా అత్యంత సామర్థ్యం ఉన్న వ్యవస్థలలో లేదు, కానీ వాస్తవిక దాడి workflowను గణనీయంగా ముందుకు తీసుకెళ్లగలదు, కాబట్టి దానికి తీవ్ర దృష్టి అవసరం.
ఆ సూక్ష్మత ముఖ్యమైనది. AI cyber risk గురించి ప్రజా చర్చ సాధారణంగా రెండు అంచుల మధ్య ఊగిసలాడుతుంది: frontierతో పోలిస్తే ఏ లోటైనా తక్కువ ప్రమాదమే అని భావించడం లేదా చూపిన ఏ సహాయమైనా ఉత్తమ మోడళ్లతో సమానమని భావించడం. ఇక్కడ ఇచ్చిన data ఈ రెండు అభిప్రాయాల్లో దేనినీ సమర్థించదు. Kimi K3 U.S. frontier కంటే గణనీయంగా వెనుకగా కనిపిస్తోంది, అయినా కొన్ని పనుల్లో దురుద్దేశ్య వినియోగదారుల శ్రమను తగ్గించేంత సామర్థ్యం కలిగి ఉంది.
మోడల్ పోటీపై ఈ ఫలితాలు ఏమి సూచిస్తున్నాయి
The Decoder కూడా గమనించినదేమిటంటే, Kimi K3 ఫలితాలు Moonshot AI మరింత advanced మోడళ్లను distilled చేసిందని ఉన్న ఆరోపణలకు అనుగుణంగా ఉన్నాయి. ఇచ్చిన text ఆ ఆరోపణను వాస్తవంగా నిర్ధారించదు, అలాగే benchmark ఫలితాలు మాత్రమే మోడల్ ఎలా శిక్షణ పొందిందో రుజువు చేయలేవు. కానీ ఈ సూచన గమనించదగినది, ఎందుకంటే ఇది Kimi K3ను performance storyగానూ development-process storyగానూ ఫ్రేమ్ చేస్తుంది. distillation లేదా distillation-like పద్ధతుల ద్వారా నిర్మించిన మోడల్ ఈ స్థాయి cyber utilityకి చేరగలిగితే, సామర్థ్యవంతమైన offensive assistanceకి దారితీసే మార్గం మరింత విస్తృత నటుల కోసం చౌకగా మరియు వేగంగా మారవచ్చు.

అదే సమయంలో, distillation involved అయి ఉంటే కూడా, అది ఉత్తమ U.S. మోడళ్లతో ఉన్న performance gapను తొలగించలేదని సంఖ్యలు సూచిస్తున్నాయి. source text ప్రకారం, ఈ మూల్యాంకనంలో open-weight మోడళ్లలో Kimi K3 ఒక కొత్త benchmarkను నెలకొల్పింది, కానీ అత్యంత బలమైన U.S. వ్యవస్థలు exploit completionలో మరియు అత్యంత తీవ్రమైన control స్థాయికి చేరడంలో ఇంకా పెద్ద ఆధిక్యతను నిలుపుకున్నాయి. దీని వల్ల పోటీ చిత్రం ఇప్పటికే ఎవరు సమానమో అనే దానికంటే, వెనుకబడిన స్థాయి ఎంత వేగంగా మెరుగుపడుతోందో అన్నదానిపై ఎక్కువ దృష్టి పెడుతుంది.
ప్రభుత్వాల కోసం, ఈ నివేదిక సాధారణ AI safety భాషను దాటి, స్పష్టమైన risk surfacesపై దృష్టి పెట్టాల్సిన ఒత్తిడిని పెంచుతుంది. Cyber capabilityని అనేక ఊహాత్మక హానుల కంటే సులభంగా పరీక్షించవచ్చు, ఎందుకంటే ఇది నిర్వచిత పనులు, staged environments, మరియు కొలిచగల ఫలితాలపై benchmark చేయవచ్చు. Kimi K3 మూల్యాంకనం ఈ విధానం విలువను చూపిస్తుంది. సారాంశంగా సామర్థ్యంపై వాదించడానికి బదులుగా, సంస్థలు applied testsను ఉపయోగించి ఒక మోడల్ exploit writing మరియు intrusion workflowsకు గణనీయంగా సహాయపడగలదో లేదో నిర్ణయించాయి.
ఇది ఇప్పుడు ఎందుకు ముఖ్యం
విస్తృత విధాన సమస్య ఒక్క చైనా మోడల్కే పరిమితం కాదు. open లేదా మరింత విస్తృతంగా అందుబాటులో ఉన్న వ్యవస్థలు frontier performanceకు చేరకముందే ఉపయోగపడేంత offensive competenceను కూడబెట్టగలవని ఈ ఫలితం చూపిస్తోంది. ఇది release strategies, safeguards, మరియు deployment తర్వాత monitoring గురించి కఠినమైన ప్రశ్నలను లేవనెత్తుతుంది. ఒక మోడల్ ప్రపంచంలో ఉత్తమమైనదిగా ఉండాల్సిన అవసరం లేదు; దాన్ని సులభంగా పొందగలిగితే మరియు అది comply చేయడానికి సిద్ధంగా ఉంటే threat landscapeను మార్చగలదు.
ప్రస్తుతం, అందిన ఆధారాలు layered conclusionను సూచిస్తున్నాయి. ఇక్కడ GLM-5.2 ద్వారా ప్రతినిధీకరించబడిన పూర్వపు సరిపోలే Chinese open-weight మోడళ్ల కంటే Kimi K3 బలమైన cyber performer. అత్యంత కఠినమైన exploit పనుల్లో ఇది అగ్ర U.S. frontier వ్యవస్థల కంటే ఇంకా చాలా వెనుక ఉంది. మరియు ఆ గ్యాప్ ఉన్నప్పటికీ, ఇది అర్థవంతమైన ప్రతిఘటన లేకుండా దాడి లక్ష్య సైబర్ కార్యకలాపాలకు ఇంకా సహాయం చేయగలదు. ఈ మూడు పాయింట్లు కలిసి ఈ మూల్యాంకనాన్ని ముఖ్యమైనదిగా చేస్తాయి. ఇవి పురోగతి, కొనసాగుతున్న అసమానత, మరియు నిజమైన భద్రతా ఆందోళనను ఒకేసారి చూపుతాయి.
- Kimi K3 ExploitBenchలో 32.2 శాతం సాధించింది, అగ్ర U.S. మోడళ్లు 76.2 శాతం సాధించాయి.
- బెంచ్మార్క్లోని 41 పనుల్లో ఏదిలోనూ మోడల్ Arbitrary Code Executionను సాధించలేదు.
- Kimi K3 exploit development మరియు దాడి లక్ష్య సైబర్ కార్యకలాపాలకు గణనీయమైన ప్రతిఘటన లేకుండా సహాయం చేసింది అని మూల్యాంకనం కనుగొంది.
ఈ వ్యాసం The Decoder యొక్క నివేదికపై ఆధారపడింది. మూల వ్యాసాన్ని చదవండి.
Originally published on the-decoder.com
