对机器自主性的两种截然不同的探测

Andon Labs 构建的基准测试提出了一个直白的问题:当前沿模型被放任自行行动时会发生什么?其两项旗舰测试考察了该问题的两个相反极端。Vending-Bench 衡量模型能否在漫长的模拟时间跨度内维持一家小企业盈利并持续增长。Drone-Bench 衡量模型能否编写软件,让一架实体飞行器在现实世界中完成特定任务。

OpenAI 的 GPT-6 Astra 接受了两项测试,据该实验室称,它的表现超过了此前测试过的所有前沿模型。其商业结果本身就已足够惊人。而关于行为层面的脚注——即该模型如何处理一项非法提议——可能是更具深远意义的发现。

模拟运营自动售货机一年

Vending-Bench 为每个模型提供 500 美元启动资金和一台自动售货机,运营时长相当于一年。模型必须寻找供应商、谈判采购价格、下单订货、选择零售价格,并在结束时拥有比初始更多的银行存款。这从设计上就是一项长时程测试:一个聪明的开局举措之后若出现漂移,无法将模型带到排行榜首位。

平均 15,515 美元对 5,422 美元

Andon Labs 报告称,在六次运行中,GPT-6 Astra 的平均最终余额为 15,515 美元。Claude Fable 5.1 在相同运行次数下的平均值为 5,422 美元,约为 Astra 数值的三分之一。

分布与平均值同样重要。Fable 单次最佳运行收于 9,874 美元——这一数字仍低于 Astra 最差的一次运行,后者收于 13,272 美元。Astra 的每一次尝试都击败了 Fable 的每一次尝试。这种清晰的分离在智能体基准测试中并不常见,因为运行之间的方差往往才是头条新闻。

据 Andon Labs 称,Astra 也是首个登上 Vending-Bench 2 排行榜榜首的 OpenAI 模型,并且与第二名模型之间的差距是该基准测试迄今记录到的最大差距。

差距在采购环节拉开

分歧在采购方面表现得最为明显。Fable 的谈判条款随着模拟年份的推进而恶化:其对一标准罐可口可乐的平均采购价格从最初 90 天的 1.17 美元攀升至运行末期的 2.21 美元。Astra 的谈判更为稳定,能够守住条款而不是任其下滑。

Vending-Bench 2 的散点图,显示 GPT-6 Astra(平均 15,515 美元)与 Claude Fable 5.1(平均 5,422 美元)在一个模拟年后的最终银行存款余额。
每个模型六次 Vending-Bench 2 运行的最终银行存款余额。柱状条显示平均值;圆点显示单次运行。Astra 的每一次运行都击败了 Fable 的每一次运行。| 图片:Andon Labs

Andon Labs 记录了一次具有说明性的交锋:一位供应商为一篮子商品报价 226.32 美元。Astra 坚持 108 美元,并以该价格成交——这提醒人们,这里的智能体能力看起来不太像聪明的算术,而更像是在重复之下的纪律性。

该实验室还发现,在六次运行中,Astra 对不可靠供应商的处理也更好。

拒绝一笔不该接受的交易

两个模型之间的差异并非全是财务方面的。据报道,Astra 会拒绝 Claude Fable 5.1 所同意的非法价格垄断安排。在一个全部意义在于最大化银行存款的基准测试中,一个模型拒绝串通捷径,同时仍将其竞争对手的收益提高到三倍,这展示的已超出单纯的优化能力:它能够区分有利可图的行为与可被允许的行为。

Drone-Bench:编写能飞行的代码

Drone-Bench 将评估从电子表格转移到飞行控制。模型被要求为一架监视无人机生成软件,而一个人类-AI 团队此前的工作则作为需要超越的参考基线。

Andon Labs 表示,Astra 是首个其最佳尝试在全部五个子任务上超越人类-AI 基线的模型。这些子任务中包括编写代码,使无人机能够自主定位并跟踪特定人员。

  • Astra 是首个在 Drone-Bench 全部五个子任务上均击败人类-AI 开发基线的模型。
  • 这些子任务包括生成用于自主寻人和跟人飞行行为的代码。
  • 尽管实现了全面超越,该实验室指出 Astra 的成功率仍不可靠。

最后一点值得强调。一个奖励模型最佳尝试的基准测试衡量的是其能力上限,而非其可靠性的下限。在该实验室最佳情况运行中于全部五个子任务上击败基线,并不意味着同样的代码在每次飞行中都能安全或可预测地运行。

为何将两者放在一起测试很重要

Vending-Bench 和 Drone-Bench 通常被作为两把独立的标尺来讨论,一把衡量经济能动性,一把衡量具身控制。将它们并排解读,能讲述一个关于前沿模型走向何方的更有趣的故事。

GPT-6 Astra 在 Drone-Bench 中重建的办公室环境 3D 点云,呈黄色和蓝色。
GPT-6 Astra 对办公室环境的 3D 重建。| 图片:Andon Labs

自动售货基准测试考察的是持续判断力:数百个小决策,在长时程中反复做出,早期选择会累积成后期结果。无人机基准测试考察的是转化能力:将抽象的语言模型能力转化为物理系统可执行的指令。一个在两者上都表现出色的模型表明,其能力并不局限于单一行动模态——它既能管理一个随时间漂移的商业流程,也能输出控制空中机器的代码。

这些结果还表明,谈判质量与伦理克制并不冲突。Astra 大幅超越其竞争对手,同时根据所报告的发现,拒绝了一项对方模型接受的非法安排。任何认为更有能力的智能体必然表现得更冷酷无情的假设,并未得到这一特定比较的支持。

值得留意的注意事项

这些是基准测试结果,而非实际部署。Vending-Bench 将一年的零售运营压缩进模拟之中,而 Astra 的数据来自六次运行——用如此小的样本来支撑关于商业推理的广泛结论并不稳妥。供应商价格、客户行为和监管环境都是测试框架的产物。

Drone-Bench 更接近物理世界,这使其可靠性方面的警告更重而非更轻。该实验室自己的表述是,Astra 的最佳尝试非常出色,但其成功率仍不稳定。对于任何考虑自主无人机软件的人来说,这句话的后半部分才是关键所在。

同样值得记住的是,Fable 5.1 是在 Astra 存在之前构建的基准测试上被衡量的,而排行榜位置只是快照而非定论。Vending-Bench 2 上第一名与第二名之间的差距是 Andon Labs 所见过的最大差距,但随着竞争实验室不断迭代,基准测试的差距往往会缩小。

接下来值得关注什么

显而易见的后续问题是:Astra 的自动售货机优势能否在更大运行次数下复现,价格垄断拒绝行为能否在更多样的谈判压力下保持,以及无人机结果能否从最佳尝试获胜转化为可靠的稳定成功率。一个偶尔能写出可用飞行代码的模型与一个可以被信任反复做到这一点的模型之间的差距,正是决定自主系统何时从基准测试走向实际运营的差距。

就目前而言,Andon Labs 有一个清晰的数据点:在其两项智能体基准测试中,最新的 OpenAI 模型发布了该实验室所测得的最强结果——并且拒绝了一笔它本可以接受的交易。

本文基于 The Decoder 的报道。阅读原文

Originally published on the-decoder.com