Anthropic 称 AI 代理的防御能力取得重大提升
Anthropic 表示,其 Opus 5 模型在抵御 AI 代理中最顽固的安全问题之一方面取得了实质性进展:基于浏览器的提示注入。根据公司系统卡中引用的细节,在启用 Anthropic Auto Mode 防护措施的情况下,Opus 5 用于浏览器代理时,129 个测试场景中的提示注入攻击无一成功。
如果这一结果经得起更广泛的审视,它将标志着代理式 AI 的一项重要进展。提示注入已成为部署可浏览网页、读取文档或代表用户执行操作的系统时的核心障碍。其基本问题出奇地简单:攻击者把恶意指令隐藏在网页或其他输入中,而模型会遵循这些指令,而不是它原本应当服从的更高优先级规则。
这种失败模式长期困扰着可靠 AI 代理的设想,因为这类攻击并不依赖于突破传统软件边界。它利用的是语言模型解释文本的方式。因此,即便是能力很强的模型,也可能在缺少额外防护时被恶意或误导性内容操纵。
Anthropic 说改变了什么
据称的 0% 成功率并非只来自 Opus 5 模型本身。该结果是在 Anthropic 产品中启用 Auto Mode 时出现的,例如 Claude Cowork。在这种设置下,有两层独立防护同时生效。一层在模型处理内容之前扫描传入内容中的隐藏或恶意指令。另一层则会在危险操作执行前予以阻止。
这一区别很重要。Anthropic 自身的数据表明,在没有这些额外防护时,Opus 5 在浏览器代理场景中的攻击成功率仍为 3.7%。因此,这一突破更像是系统层面的改进,而不是证明提示注入已在模型层面被单独解决。
这种系统层面的表述对整个行业很重要。AI 代理中的安全问题正越来越多地被视为栈层问题,而不仅仅是模型问题。模型可能变得更强,但输入过滤、策略执行、权限管理和动作门控,都会影响攻击是否真正奏效。
基准结果显示进展,但远未尘埃落定
来源还提到了安全公司 Gray Swan 的提示注入基准结果。在一项通用测试中,攻击者在 15 次尝试后的成功率据称从 Opus 4.8 的 5.5% 降至 Opus 5 的 2.0%。这使得 Opus 5 领先于对比中提到的其他模型,包括 Mythos 5 的 2.6% 和 Fable 5 的 2.8%。
这些数字表明确实有进步,但也凸显了“提示注入已被解决”这一标题式说法的局限性。即使按照 Anthropic 自己的呈现,最理想的结果也依赖于一个启用了多重防护的特定产品配置。若没有这些防护,攻击成功率并不会降为零。而且,在来源引用的另一项对比中,Sonnet 5 在未受保护的浏览器代理条件下的表现优于 Opus 5,成功率为 0.93%,而 Opus 5 为 3.7%。

换句话说,更稳妥的结论不是某个单一模型已经彻底消除了这个问题,而是 Anthropic 可能为浏览器代理组装出了一套比此前更强的实用防御方案。
这对代理竞赛为何重要
提示注入并不是一个边缘安全问题。它直接影响代理式 AI 最有商业价值的承诺:让系统在有限监督下穿梭于在线工具和信息源之间。如果这些系统会被隐藏文本、被破坏的指令或对抗性排版所重定向,那么它们在采购、管理、编码、研究或客户运营等真实工作流中的可信度就会大打折扣。
这也是为什么即便攻击成功率的下降幅度不大,也仍然重要。成功被操纵的概率越低,企业愿意自动化的任务范围就越大。对供应商而言,这也可能成为一个竞争差异化因素,尤其是在模型能力趋于接近、买家开始更关注运行可靠性而非原始基准表现的情况下。
这个问题已经严重到 OpenAI 在 12 月承认提示注入可能永远无法被彻底解决。这样的观点反映出一个更广泛的行业担忧:由于语言模型的设计本就是吸收并响应自然语言输入,它们可能在某些指令冲突形式上始终存在固有暴露。防御性工程可以降低风险,但要在开放式环境中保证完全免疫,可能并不容易。
接下来关注什么
下一个问题是 Anthropic 的结果能否被复现并推广。内部系统卡数据可以提供信息,但外部验证通常决定一项安全进展是否会成为值得信赖的行业实践。研究人员很可能会想知道这 129 个浏览器代理场景是如何构造的、包含了哪些类型的攻击、它们在多大程度上代表真实世界的对抗手段,以及当攻击者进行适应时这些防护会如何表现。
另一个未解问题是可用性。最强的 AI 安全系统往往会带来摩擦,要么阻止含糊不清的操作,要么限制代理可自主执行的动作。如果 Auto Mode 的防护极其有效,但经常干扰合法任务,企业就必须在安全与生产力之间权衡。来源文本没有提供这方面的运行语境,因此目前的结论仅限于抗攻击能力,而不是完整的产品表现。
不过,方向性的信号已经很清楚。Anthropic 认为,更安全的代理路线不仅是更聪明的基础模型,还包括把恶意输入视为常态条件的分层架构。这种做法与成熟的软件安全演进路径一致:不是依赖单一完美屏障,而是通过多个检查点逐步提高攻破难度。
对于 AI 行业来说,这或许才是这里真正的里程碑。即便提示注入并未消失,模型改进与紧密集成的防御工具结合起来,或许终于正在把它从一个根本性阻碍,转变为一个更可控的工程问题。
本文基于 The Decoder 的报道。阅读原文。
Originally published on the-decoder.com



