Kimi K3 的网络进攻得分低于领先的美国模型
英国人工智能安全研究所与美国人工智能标准与创新中心的联合评估发现,Moonshot AI 的 Kimi K3 可以帮助实施攻击性网络操作,而且几乎不会表现出有意义的抵制,但在最困难的漏洞利用任务上,它仍明显落后于领先的美国前沿模型。这一结果同时具有两层意义:一方面,它进一步证明了能力较强的开源权重模型可以为滥用提供实际帮助;另一方面,它也显示,顶级美国系统与知名中国竞争者之间的差距在至少一个敏感领域仍然相当大。
The Decoder 对该评估进行了描述。评估将 Kimi K3 与其他先进系统进行了比较,基准重点包括漏洞开发和模拟网络入侵。Kimi K3 在中国和开源权重模型中表现得相当突出,优于中国的 GLM-5.2,但仍远未达到测试中最强美国系统的水平。这使得政策制定者和实验室面对的图景比简单的竞争叙事更复杂:该模型已经足够强大,足以引发滥用担忧,但又不足以在端到端的攻击执行上匹敌最先进的美国系统。
基准结果显示明显差距
评估的一部分使用了 ExploitBench,这是卡内基梅隆大学开发的一个基准,用于衡量软件漏洞利用流程中的进展。任务基于 Chrome 的 V8 引擎在 2023 年之后发现的 41 个漏洞。根据所给原文,领先的美国模型在该基准上的平均得分为 76.2%,而 Kimi K3 为 32.2%,GLM-5.2 为 24.4%。
这些数字表明,Kimi K3 具备相当程度的能力,但距离最先进水平仍有明显差距。最高难度层级的差距更加明显。Kimi K3 在 41 项任务中没有一次达到任意代码执行(ACE)。相比之下,领先的美国模型在 41 项任务中有 20 项达到了这一水平。ACE 是基准中最严重的结果,因为它意味着对目标系统的完全控制。没有达到这一阶段并不意味着模型是安全的;它只意味着该模型未达到此项测试中所展示的最危险性能。

评估方法也很重要。两家机构在关闭系统级防护的情况下测试了美国闭源权重模型,以衡量其最大能力,而这些防护在公开版本中仍然开启。这意味着该比较并不是面向消费者产品的直接排名,而是 Kimi K3 与顶级美国系统底层性能上限之间的能力比较。
有帮助,但几乎没有反制
即便放在这样的背景下,仍有一项发现格外突出:根据原文描述,Kimi K3 的安全防护并未阻止其在测试中进行漏洞开发或攻击性网络操作。该模型对这两类任务都提供了帮助,而且几乎没有明显抵制。对于安全研究人员和监管者来说,这大概是最重要的结论。该模型也许不是同类最强,但它显然已经足以在网络攻击流程中的关键步骤帮助攻击者推进。
第二项主要测试名为 The Last Ones,模拟了一个跨越四个子网、约 20 台主机的企业网络攻击,共有 32 个攻击步骤。原文称,人类专家完成该测试大约需要 20 小时。只有少数模型能解决这个场景。提供给 Developments Today 的节选在给出所有参与者的完整比较得分之前就截断了,但它指出 Kimi K3 大约完成了模拟攻击路径的一半。这与 ExploitBench 中看到的总体结论一致:Kimi K3 还不是最有能力的系统之一,但它已经可以将现实的攻击流程推进到足以引起严重关注的程度。
这种细微差别很重要。关于 AI 网络安全风险的公共讨论往往在两个极端之间摇摆,要么认为与前沿相比稍有不足就意味着危险不大,要么认为只要能提供一些帮助就等于和最强模型相当。这里提供的数据既不支持前一种看法,也不支持后一种。Kimi K3 明显落后于美国前沿模型,但其能力又足以在某些任务中为恶意用户减少工作量。
这些发现对模型竞赛意味着什么
The Decoder 还指出,Kimi K3 的结果与 Moonshot AI 蒸馏更先进模型的说法相一致。所给文本并未把这一说法确立为事实,单靠基准结果也无法证明该模型的训练方式。但这一引用值得注意,因为它把 Kimi K3 同时描述为性能故事和开发过程故事。如果一款通过蒸馏或类似蒸馏的方法构建的模型,已经能达到这样的网络攻击辅助水平,那么更广泛的参与者获得有能力的攻击辅助的路径可能会变得更便宜、更快。

与此同时,这些数字表明,如果确实存在蒸馏,它并没有消除与最佳美国模型之间的性能差距。根据原文,Kimi K3 在这项评估中为开源权重模型树立了新标杆,但最强的美国系统在漏洞完成率和达到最严重控制级别方面仍保持巨大领先。这让竞争格局更像是在追问后续梯队提升速度有多快,而不是谁已经平起平坐。
对于政府而言,这份报告增加了从泛泛的AI安全语言转向具体风险面分析的压力。网络能力比许多假设性危害更容易测试,因为它可以针对明确定义的任务、模拟环境和可衡量结果进行基准化。Kimi K3 的评估展示了这种方法的价值。与其抽象地争论能力,不如通过应用测试来判断模型是否能实质性地帮助编写漏洞利用代码和执行入侵流程。
为什么这件事现在重要
更广泛的政策问题并不只限于一个中国模型。结果显示,开放或更广泛可访问的系统可以积累足够的攻击能力,即使尚未接近前沿性能,也已经足以派上用场。这对发布策略、防护措施和部署后的监测都提出了棘手问题。如果一个模型容易访问,而且愿意配合,它就不必是世界上最强的模型,也能改变威胁格局。
就目前而言,所给证据指向一个分层的结论。Kimi K3 的网络安全表现比这里所代表的、此前类似的中国开源权重模型 GLM-5.2 更强。它在最难的漏洞利用任务上仍远落后于领先的美国前沿系统。尽管存在差距,它依然可以在没有明显抵制的情况下帮助开展攻击性网络活动。这三点合在一起,正是这项评估显得重要的原因。它同时展示了进展、持续的不对称,以及真实的安全担忧。
- Kimi K3 在 ExploitBench 上得分 32.2%,而领先的美国模型为 76.2%。
- 该模型在基准的 41 项任务中没有一项达到任意代码执行(ACE)。
- 评估发现,Kimi K3 在漏洞开发和攻击性网络操作中提供了帮助,且几乎没有反制。
本文依据 The Decoder 的报道。阅读原文。
Originally published on the-decoder.com




