一个新的基准提出了更难的 AI 问题:不是代理能否帮上忙,而是它们何时值得用?
随着 AI 系统不断进步,最重要的现实问题之一正从“它们能不能完成某项任务”转向“它们能否以低于人类的总成本完成任务”。专注于评估先进 AI 系统的研究机构 METR 提出了一项新指标,直接回答这个问题。它将这一衡量方式称为“支出视界”,其核心思路很简单:比较 AI 系统和人类为了达到同等改进水平各自需要投入多少成本,然后找出二者成本相等的临界点。
这一想法之所以重要,是因为许多常见的 AI 基准测试会把表现压缩成简单的成败结果。这些测试可以展示模型是否解决了问题,却往往很少说明达成结果过程中涉及的经济权衡。对于正在决定 AI 自动化究竟在哪些场景中真正可行的公司、实验室和政策制定者来说,这种缺失越来越难以忽视。
支出视界如何运作
根据源材料,METR 的框架把人力成本、运行 AI 系统的成本以及实验中使用的算力放在同一个比较框架里。结果是一种更连续的价值衡量,而不是二元评分。如果 AI 所需预算低于人类为获得同样改进所需的预算,AI 就处于支出视界的有利一侧;如果 AI 需要更多投入,人类仍然是更便宜的选择。
这种表述之所以有用,是因为它符合许多组织实际做决策的方式。它们很少会问 AI 是否能生成任何输出,而是会问,在把监督、试验、重试和基础设施都算进去之后,使用 AI 是否能降低成本、节省时间,或者两者兼得。一个在演示中看起来很出色的代理,如果要消耗过多算力或需要太多辅助运行,依然可能无法通过这一测试。
METR 认为,这种方法相较于更常见的评估有两大优势。第一,它给出的是细粒度的经济价值,而不是通过或失败的标签。第二,它把多个不同输入转换为同一种货币,使人类和机器的投入更容易放在同一框架下比较。
在 NanoGPT speedrun 上测试这一想法
为了试验这一指标,METR 使用了 NanoGPT speedrun,这是一个公开的社区项目,参与者通过改进训练方法而不是改变任务本身,竞赛式地在标准化硬件上尽快训练出一个语言模型。由于目标稳定而且性能改进可以随时间跟踪,这个项目为比较提供了一个异常清晰的环境。

源材料称,这项 speedrun 自 2024 年 5 月起记录了 82 个已文档化的改进步骤,使累计训练时间从大约 45 分钟降至不到 2 分钟。这段历史记录让 METR 能够估算每一次边际提升所消耗的人力,并将其与要求 AI 系统生成类似进展的成本进行比较。
为了估算人类投入,METR 采访了该项目两位最活跃的贡献者,同时还使用了一个 AI 模型 Opus-4.6 来估算每项改进背后的工作量。两种方法得出了相近的粗略结果:每提升 1% 速度,大约需要 16 小时工作量。源材料进一步将人类一侧的成本描述为每提升 1% 速度约花费 2500 美元。
为什么这一早期结果对 AI 代理来说并不乐观
源材料描述的早期发现并不是一个高调的胜利。在这个基准上,支出视界对今天的代理来说似乎并不理想。这并不意味着 AI 系统在优化型工作中毫无用处,但它确实表明,在把全部成本都算进去之后,它们在更困难或更高预算的改进任务上,可能仍然难以超过人类贡献者。
这一模式与 AI 评估中的一个更广泛直觉相吻合:代理往往在小型、低成本、边界清晰的问题上表现最强,而随着任务变得更复杂、更昂贵,它们的优势会减弱。源文本称,METR 在更早的测试中也见到过类似情况。AI 可以在更简单、成本更低的任务上击败人类,但当预算上升、问题变难时,人类往往会成为更经济的选择。
这对围绕自主 AI 工程的夸张叙事构成了重要校正。如果一个代理能够很快给出有用的改动,它或许在狭窄的运营范围内是划算的。但如果它需要大量试验、反复提示、巨额推理费用或昂贵的支撑算力,商业逻辑就会迅速被削弱。支出视界正是试图量化这种削弱从何处开始。

这一指标说明了什么,又遗漏了什么
METR 这一提案的价值在于,它把讨论从原始能力转向了经过成本调整的能力。这是一个要求更高的标准,对于现实部署来说,也可能是正确的标准。企业之所以采用工具,不是因为它们新奇,而是因为它们能提高吞吐量、降低成本、扩展产能,或兼而有之。一个无法反映这些结果的基准,其实际价值就有限。
与此同时,源文本也指出,这一指标存在盲点。任何把人力、实验算力和 AI 运行成本压缩为单一美元比较的框架,都不可避免地建立在一些假设之上。人类工作的质量会变化,小时费率也会变化。有些 AI 生成的想法可能很容易被丢弃,而另一些则可能带来超额收益。基准任务的选择同样重要。NanoGPT speedrun 公开、可衡量且具有技术相关性,但它终究只是一个领域。
还有一个重要但书来自源材料:更新一代模型可能很快改变局面。今天令人失望的支出视界,并不能为明年下结论。如果模型质量提升、工具使用更可靠,或推理成本下降,人类与 AI 经济性的交叉点可能会发生显著移动。
为什么这不仅关乎一个基准
即便存在这些限制,METR 的提案仍恰逢其时。围绕 AI 的讨论充斥着关于生产力、加速和自我改进系统的说法。而其中很多争论仍然停留在抽象层面,因为业界缺少一种共享方式来在同等基础上比较人类和机器的投入。支出视界正是在尝试建立这样一种方式。
它最大的贡献也许更多是文化层面,而非技术层面。它把评估从戏剧化演示推向预算现实。这正是当前市场需要施加的压力,因为企业越来越需要用可衡量的回报来证明 AI 支出合理。如果这一指标传播开来,它可能帮助区分那些代理确实经济划算的工作流,与那些只有在把全部成本都算进去之前看起来高效的工作流。
就目前而言,METR 的早期结果给出的结论是克制的。AI 代理也许已经能在某些狭窄的优化任务中发挥作用,但不应预设它们具有成本优势。在买家和构建者最关心的地方,问题不再只是模型能做什么,而是模型能以比人类更低的成本做什么。
本文基于 The Decoder 的报道。阅读原文。
Originally published on the-decoder.com




