Kimi K3 సైబర్ దాడి స్కోర్లు అగ్ర U.S. మోడళ్ల కంటే బలహీనంగా ఉన్నాయి

బ్రిటిష్ AI Security Institute మరియు U.S. Center for AI Standards and Innovation నిర్వహించిన సంయుక్త మూల్యాంకనంలో, Moonshot AI యొక్క Kimi K3 దాడి లక్ష్య సైబర్ కార్యకలాపాలకు సహాయం చేయగలదని, అలాగే దానికి అర్థవంతమైన ప్రతిఘటన చాలా తక్కువగా ఉంటుందని కనుగొన్నారు. కానీ అత్యంత కఠినమైన exploit పనుల్లో ఇది అగ్ర U.S. frontier మోడళ్ల కంటే ఇంకా స్పష్టంగా వెనుకబడింది. ఈ ఫలితం ఒకేసారి రెండు కారణాల వల్ల ముఖ్యమైనది: సామర్థ్యవంతమైన open-weight మోడళ్లు దుర్వినియోగానికి వాస్తవిక సహాయాన్ని ఇవ్వగలవని ఆధారాలను ఇది పెంచుతుంది, అలాగే కనీసం ఒక సున్నితమైన రంగంలో అగ్ర U.S. వ్యవస్థలు మరియు ప్రముఖ చైనా పోటీదారుల మధ్య గ్యాప్ ఇంకా గణనీయంగా ఉందని చూపిస్తుంది.

The Decoder వివరించిన ఈ మూల్యాంకనం, exploit development మరియు simulated network intrusion లక్ష్యంగా రూపొందించిన బెంచ్‌మార్క్‌లపై Kimi K3ను ఇతర advanced systems‌తో పోల్చింది. చైనా మరియు open-weight మోడళ్లలో Kimi K3 ఒక గమనించదగిన ముందడుగుగా నిలిచింది, చైనాకు చెందిన GLM-5.2ను మించి ప్రదర్శించింది, కానీ పరీక్షించిన అత్యంత బలమైన U.S. వ్యవస్థల స్థాయికి అది చేరలేదు. దీని వల్ల విధాన నిర్ణేతలు మరియు ల్యాబ్‌లకు సాదా పోటీ కథకంటే క్లిష్టమైన చిత్రం కనిపిస్తుంది: దుర్వినియోగ ఆందోళనలను పెంచేంత సామర్థ్యం మోడల్‌కు ఉన్నట్లు కనిపిస్తుంది, కానీ end-to-end దాడి అమలులో అత్యంత అధునాతన అమెరికన్ వ్యవస్థలను తాకేంత మాత్రం లేదు.

బెంచ్‌మార్క్ ఫలితాలు పెద్ద గ్యాప్‌ను చూపాయి

మూల్యాంకనంలోని ఒక భాగంలో ExploitBenchను ఉపయోగించారు, ఇది Carnegie Mellon University సాఫ్ట్‌వేర్ exploitation ప్రక్రియలో పురోగతిని కొలవడానికి అభివృద్ధి చేసిన బెంచ్‌మార్క్. ఈ పనులు 2023 తర్వాత Chrome యొక్క V8 engineలో కనుగొనబడిన 41 vulnerabilities ఆధారంగా ఉన్నాయి. ఇచ్చిన source text ప్రకారం, అగ్ర U.S. మోడళ్లు ఈ బెంచ్‌మార్క్‌లో సగటున 76.2 శాతం సాధించగా, Kimi K3 32.2 శాతం, GLM-5.2 24.4 శాతం సాధించాయి.

ఈ సంఖ్యలు Kimi K3 గణనీయంగా సామర్థ్యం ఉన్నదని సూచిస్తున్నాయి, కానీ అది ఇంకా state of the art‌కి చాలా దూరంలో ఉంది. అత్యధిక కష్టం స్థాయిలో ఈ గ్యాప్ మరింత స్పష్టమవుతుంది. Kimi K3 41 పనుల్లో ఏదిలోనూ Arbitrary Code Executionను చేరలేదు. దీనికి విరుద్ధంగా, అగ్ర U.S. మోడళ్లు 41లో 20 పనుల్లో ఆ స్థాయిని సాధించాయి. Arbitrary Code Execution అనేది బెంచ్‌మార్క్‌లో అత్యంత తీవ్రమైన ఫలితం, ఎందుకంటే అది లక్ష్య వ్యవస్థపై పూర్తిస్థాయి నియంత్రణను సూచిస్తుంది. ఆ దశకు చేరకపోవడం మోడల్ సురక్షితమని అర్థం కాదు; ఈ నిర్దిష్ట పరీక్షలో అది అత్యంత ప్రమాదకరంగా ప్రదర్శించబడిన స్థాయి కంటే తక్కువగా నిలిచిందని మాత్రమే అర్థం.

Kimi K3 ExploitBench బెంచ్‌మార్క్‌లో 32.2 శాతం సాధించింది, అయితే అగ్ర U.S. మోడళ్లు 76.2 శాతం చేరాయి. GLM-5.2 24.4 శాతంతో వెనుకబడింది. | Image: UK AISI / CAISI
Kimi K3 ExploitBench బెంచ్‌మార్క్‌లో 32.2 శాతం సాధించింది, అయితే అగ్ర U.S. మోడళ్లు 76.2 శాతం చేరాయి. GLM-5.2 24.4 శాతంతో వెనుకబడింది. | Image: UK AISI / CAISI

మూల్యాంకన విధానం కూడా ముఖ్యమైనది. సంస్థలు U.S. closed-weight మోడళ్లను system-level safeguards ఆఫ్ చేసి పరీక్షించాయి, తద్వారా గరిష్ట సామర్థ్యాన్ని కొలిచారు, అయితే ప్రజలకు అందుబాటులో ఉన్న వెర్షన్‌లలో ఆ safeguards కొనసాగుతూనే ఉంటాయి. అంటే ఇది వినియోగదారుల ముఖం ఉన్న ఉత్పత్తుల ప్రత్యక్ష ర్యాంకింగ్ కాదు. బదులుగా, ఇది Kimi K3 మరియు అగ్ర U.S. వ్యవస్థల underlying performance ceiling మధ్య సామర్థ్య పోలిక.

అర్థవంతమైన ప్రతిఘటన లేకుండా సహాయం

అయినా కూడా ఒక ముఖ్యమైన కనుగొనడం స్పష్టంగా కనిపిస్తుంది: sourceలో వివరించిన పరీక్షల్లో Kimi K3 యొక్క safeguards exploit development లేదా దాడి లక్ష్య సైబర్ కార్యకలాపాలను అడ్డుకోలేదు. మోడల్ రెండింటికీ గణనీయమైన ప్రతిఘటన లేకుండా సహాయం చేసింది. భద్రతా పరిశోధకులు మరియు నియంత్రకుల దృష్టిలో, ఇదే ప్రధాన శీర్షిక. మోడల్ best in class కాకపోవచ్చు, కానీ ఒక దాడి చేసే వ్యక్తి సైబర్ ఆపరేషన్‌లో ముఖ్యమైన దశలు దాటడానికి ఉపయోగపడేంతవరకు వినియోగించదగినట్లు కనిపిస్తోంది.

రెండవ ప్రధాన పరీక్ష The Last Ones అనే దాని ద్వారా, నాలుగు subnets మరియు దాదాపు 20 hosts‌లో విస్తరించిన కార్పొరేట్ నెట్‌వర్క్ దాడిని 32-దశల attack pathతో సిమ్యులేట్ చేస్తుంది. source text ప్రకారం, దీన్ని పూర్తి చేయడానికి ఒక మానవ నిపుణుడికి సుమారు 20 గంటలు అవసరం. ఈ scenarioని పూర్తిగా పరిష్కరించగల మోడళ్లు చాలా తక్కువ. Developments Todayకి ఇచ్చిన excerpt అన్ని పాల్గొనేవారికి పూర్తి comparative scoring ఇవ్వకముందే నిలిచిపోయింది, కానీ Kimi K3 simulated attack pathలో సుమారు అర్ధాంతరానికి చేరిందని అది చెబుతోంది. ఇది ExploitBench‌లో కనిపించిన అదే మొత్తం నిర్ణయాన్ని బలపరుస్తుంది: Kimi K3 ఇంకా అత్యంత సామర్థ్యం ఉన్న వ్యవస్థలలో లేదు, కానీ వాస్తవిక దాడి workflow‌ను గణనీయంగా ముందుకు తీసుకెళ్లగలదు, కాబట్టి దానికి తీవ్ర దృష్టి అవసరం.

ఆ సూక్ష్మత ముఖ్యమైనది. AI cyber risk గురించి ప్రజా చర్చ సాధారణంగా రెండు అంచుల మధ్య ఊగిసలాడుతుంది: frontierతో పోలిస్తే ఏ లోటైనా తక్కువ ప్రమాదమే అని భావించడం లేదా చూపిన ఏ సహాయమైనా ఉత్తమ మోడళ్లతో సమానమని భావించడం. ఇక్కడ ఇచ్చిన data ఈ రెండు అభిప్రాయాల్లో దేనినీ సమర్థించదు. Kimi K3 U.S. frontier కంటే గణనీయంగా వెనుకగా కనిపిస్తోంది, అయినా కొన్ని పనుల్లో దురుద్దేశ్య వినియోగదారుల శ్రమను తగ్గించేంత సామర్థ్యం కలిగి ఉంది.

మోడల్ పోటీపై ఈ ఫలితాలు ఏమి సూచిస్తున్నాయి

The Decoder కూడా గమనించినదేమిటంటే, Kimi K3 ఫలితాలు Moonshot AI మరింత advanced మోడళ్లను distilled చేసిందని ఉన్న ఆరోపణలకు అనుగుణంగా ఉన్నాయి. ఇచ్చిన text ఆ ఆరోపణను వాస్తవంగా నిర్ధారించదు, అలాగే benchmark ఫలితాలు మాత్రమే మోడల్ ఎలా శిక్షణ పొందిందో రుజువు చేయలేవు. కానీ ఈ సూచన గమనించదగినది, ఎందుకంటే ఇది Kimi K3ను performance storyగానూ development-process storyగానూ ఫ్రేమ్ చేస్తుంది. distillation లేదా distillation-like పద్ధతుల ద్వారా నిర్మించిన మోడల్ ఈ స్థాయి cyber utilityకి చేరగలిగితే, సామర్థ్యవంతమైన offensive assistanceకి దారితీసే మార్గం మరింత విస్తృత నటుల కోసం చౌకగా మరియు వేగంగా మారవచ్చు.

Kimi K3 గానీ GLM-5.2 గానీ పూర్తి exploits (ACE) సాధించలేదు, అయితే అగ్ర U.S. మోడళ్లు 41 పనుల్లో 20లో అది సాధించాయి. | Image: UK AISI / CAISI
Kimi K3 గానీ GLM-5.2 గానీ పూర్తి exploits (ACE) సాధించలేదు, అయితే అగ్ర U.S. మోడళ్లు 41 పనుల్లో 20లో అది సాధించాయి. | Image: UK AISI / CAISI

అదే సమయంలో, distillation involved అయి ఉంటే కూడా, అది ఉత్తమ U.S. మోడళ్లతో ఉన్న performance gap‌ను తొలగించలేదని సంఖ్యలు సూచిస్తున్నాయి. source text ప్రకారం, ఈ మూల్యాంకనంలో open-weight మోడళ్లలో Kimi K3 ఒక కొత్త benchmark‌ను నెలకొల్పింది, కానీ అత్యంత బలమైన U.S. వ్యవస్థలు exploit completionలో మరియు అత్యంత తీవ్రమైన control స్థాయికి చేరడంలో ఇంకా పెద్ద ఆధిక్యతను నిలుపుకున్నాయి. దీని వల్ల పోటీ చిత్రం ఇప్పటికే ఎవరు సమానమో అనే దానికంటే, వెనుకబడిన స్థాయి ఎంత వేగంగా మెరుగుపడుతోందో అన్నదానిపై ఎక్కువ దృష్టి పెడుతుంది.

ప్రభుత్వాల కోసం, ఈ నివేదిక సాధారణ AI safety భాషను దాటి, స్పష్టమైన risk surfaces‌పై దృష్టి పెట్టాల్సిన ఒత్తిడిని పెంచుతుంది. Cyber capabilityని అనేక ఊహాత్మక హానుల కంటే సులభంగా పరీక్షించవచ్చు, ఎందుకంటే ఇది నిర్వచిత పనులు, staged environments, మరియు కొలిచగల ఫలితాలపై benchmark చేయవచ్చు. Kimi K3 మూల్యాంకనం ఈ విధానం విలువను చూపిస్తుంది. సారాంశంగా సామర్థ్యంపై వాదించడానికి బదులుగా, సంస్థలు applied tests‌ను ఉపయోగించి ఒక మోడల్ exploit writing మరియు intrusion workflows‌కు గణనీయంగా సహాయపడగలదో లేదో నిర్ణయించాయి.

ఇది ఇప్పుడు ఎందుకు ముఖ్యం

విస్తృత విధాన సమస్య ఒక్క చైనా మోడల్‌కే పరిమితం కాదు. open లేదా మరింత విస్తృతంగా అందుబాటులో ఉన్న వ్యవస్థలు frontier performance‌కు చేరకముందే ఉపయోగపడేంత offensive competence‌ను కూడబెట్టగలవని ఈ ఫలితం చూపిస్తోంది. ఇది release strategies, safeguards, మరియు deployment తర్వాత monitoring గురించి కఠినమైన ప్రశ్నలను లేవనెత్తుతుంది. ఒక మోడల్ ప్రపంచంలో ఉత్తమమైనదిగా ఉండాల్సిన అవసరం లేదు; దాన్ని సులభంగా పొందగలిగితే మరియు అది comply చేయడానికి సిద్ధంగా ఉంటే threat landscape‌ను మార్చగలదు.

ప్రస్తుతం, అందిన ఆధారాలు layered conclusion‌ను సూచిస్తున్నాయి. ఇక్కడ GLM-5.2 ద్వారా ప్రతినిధీకరించబడిన పూర్వపు సరిపోలే Chinese open-weight మోడళ్ల కంటే Kimi K3 బలమైన cyber performer. అత్యంత కఠినమైన exploit పనుల్లో ఇది అగ్ర U.S. frontier వ్యవస్థల కంటే ఇంకా చాలా వెనుక ఉంది. మరియు ఆ గ్యాప్ ఉన్నప్పటికీ, ఇది అర్థవంతమైన ప్రతిఘటన లేకుండా దాడి లక్ష్య సైబర్ కార్యకలాపాలకు ఇంకా సహాయం చేయగలదు. ఈ మూడు పాయింట్లు కలిసి ఈ మూల్యాంకనాన్ని ముఖ్యమైనదిగా చేస్తాయి. ఇవి పురోగతి, కొనసాగుతున్న అసమానత, మరియు నిజమైన భద్రతా ఆందోళనను ఒకేసారి చూపుతాయి.

  • Kimi K3 ExploitBench‌లో 32.2 శాతం సాధించింది, అగ్ర U.S. మోడళ్లు 76.2 శాతం సాధించాయి.
  • బెంచ్‌మార్క్‌లోని 41 పనుల్లో ఏదిలోనూ మోడల్ Arbitrary Code Executionను సాధించలేదు.
  • Kimi K3 exploit development మరియు దాడి లక్ష్య సైబర్ కార్యకలాపాలకు గణనీయమైన ప్రతిఘటన లేకుండా సహాయం చేసింది అని మూల్యాంకనం కనుగొంది.

ఈ వ్యాసం The Decoder యొక్క నివేదికపై ఆధారపడింది. మూల వ్యాసాన్ని చదవండి.

Originally published on the-decoder.com