谷歌着手封堵 AI 基准泄露
Google DeepMind 表示,它正在测试一种评估先进 AI 系统的新方法,不让测试问题或模型本身暴露在外。这项试点被描述为首个对专有前沿 AI 模型进行的双盲评估,旨在解决该行业最持久的测量问题之一:基准污染。
问题很简单,但后果重大。如果模型在训练或优化过程中已经接触过基准问题,那么强势分数就更难解读。结果可能反映的是记忆、直接接触,或针对测试的调优,而不是更广泛的能力。对于公司、研究人员、监管者和外部评估者来说,这会削弱他们用来比较模型和评估风险的主要工具之一的可信度。
根据所提供的报道,谷歌的方法是把机密测试材料放入一个经过加密保护的环境中,这样模型提供方就无法提前查看提示词。与此同时,评估方也无法访问模型权重。这样的安排旨在消除外部测试中长期存在的取舍:通常一方必须交出敏感基准数据,或者交出专有模型资产。
以 Gemini Flash Lite 为核心的试点
这项试点使用 Gemini Flash Lite 系列中的一款模型,并与包括新加坡人工智能安全研究院在内的合作方一起,在机密基准上运行。报道中的目标是在保持双方隐私的同时,仍然进行严谨的外部评估。实际操作中,基准对谷歌保持隐藏,而模型内部则对评估者保持隐藏。
这之所以重要,是因为先进模型测试越来越依赖敏感材料。在网络安全、滥用风险或政府主导的评估等领域,基准提示词本身可能就很有价值或很危险。如果这些问题泄露,测试就会失去大部分价值。如果要求模型提供方交出权重,他们也会面临知识产权和安全方面的顾虑。
文章将这一新流程描述为同时解决这两个问题的尝试。谷歌表示,它使用了来自 Google Cloud 机密计算组合中的 Confidential Space,以创建受保护的执行环境。其目的不仅是基于政策或合同的保密,而是依靠密码学验证的技术隔离。
为何基准污染问题变得更严重
基准污染并不是机器学习领域的新担忧,但随着模型规模扩大、训练数据增长以及竞争压力加剧,它变得更为严重。专有前沿系统是在海量互联网级和精选数据上训练的。这增加了基准类材料,或其近似变体,已经进入训练流程的可能性。
即便某个基准并未被直接纳入,泄露也可能通过微调、人类反馈循环、合成训练材料,或者围绕测试格式反复公开讨论所驱动的优化而发生。一旦如此,头条分数就可能高估真实世界能力。对外部观察者来说,核心问题就变成,这个基准测的是泛化,还是演练。
谷歌提出的应对办法在程序上和技术上一样重要:让测试对模型开发者保持盲态,同时让测试拥有者无法看到模型内部。这并不能消除所有评估问题,但它直接针对其中一个最具腐蚀性的问题。如果模型无法提前看到提示词,提供方就更难针对这些项目进行专门优化。
报道还指出,敏感的外部评估过去需要一种妥协。评估者可以把提示词交出去,并相信提供方不会保留或滥用它们;或者提供方分享模型权重,并接受由此带来的暴露。双盲设置旨在消除这种选择。
这不只是谷歌的问题,而是整个行业的信任问题
更广泛的意义在于,AI 基准测试已经成为治理问题,而不仅仅是排行榜问题。模型分数越来越多地被用于产品发布、企业采购、安全争论和政策讨论。如果这些分数背后的测试不可靠,那么围绕 AI 性能的大部分公共证据基础都会变得不那么可信。
文章提到一个近期案例,即 Anthropic 的 Fable 5 进行 ARC-AGI 评估时出现延迟,数据保留限制使独立测试复杂化。这个例子说明,当强模型与机密外部基准相遇时,实际操作上会出现怎样的摩擦。根据所提供报道的推断:谷歌正在把这项试点定位为一种方法,既能让这些评估更容易开展,又不必迫使任何一方作出令人不适的披露。
这里也有一种标准制定的意图。谷歌表示,希望这一努力能帮助行业构建更可靠、也更受信任的 AI 系统。这一说法应谨慎看待。试点并不是全行业解决方案,而对基准的信任也不仅仅取决于提示词保密。测试设计质量、统计严谨性、可复现性、基准范围以及评估者独立性仍然重要。但对测试过程的技术保护,可能会成为这个体系中的重要一环。
下一步值得关注什么
最重要的后续问题是,这种方法是否会超出单个试点而扩散。如果其他大型模型开发者、独立机构和政府评估者采用类似机制,这一做法可能会成为前沿模型监督的常态。如果它仍然只停留在一次性演示,其影响就会更有限。
另一个未决问题是,哪些类型的评估最能受益。文章暗示,网络安全和政府测试尤其适合,因为提示词本身可能很敏感。这一逻辑也可能延伸到某些生物安全、国家安全或商业红队场景,不过所提供文本并未直接指明这些领域。
就目前而言,主要进展很明确:Google DeepMind 正试图让 AI 基准测试从“请相信我”式安排,转向技术上强制执行的保密。在一个性能宣称常常与系统本身一样激烈争论的领域,这是一项值得注意的变化。该试点并未解决如何衡量 AI 能力的更大争议,但它确实弥补了一个基本可信度缺口。如果一个基准的目的在于测试模型能做什么,那么模型就不该提前知道考题。
本文基于 The Decoder 的报道。阅读原文。
Originally published on the-decoder.com





