GPT-6 Astra 以亮眼数据、相互矛盾的评分,以及更清晰的效率叙事亮相
OpenAI 的 GPT-6 Astra 受到的评价格外矛盾:一家基准聚合机构将其明确排在模型阵营前列,另一家则认为它整体上不过与前代持平,而一项旗舰级推理测试似乎又指向了另一种突破。结果呈现出当前 AI 竞赛的一个耐人寻味的切面,即“哪个模型最好?”这一问题的答案,越来越取决于衡量的是什么,以及为此需要付出多少算力。
根据 The Decoder 对最新公开评测的总结,Epoch AI 将 50 多项基准整合为 ECI 分数,并以 169 分将 GPT-6 Astra 排在第一位,领先 267 个模型。相比之下,Artificial Analysis 给予 Astra 在 Intelligence Index 上 61 分,与 Astra 的前代 Sol 完全持平,且落后 Anthropic 的 Claude Fable 5.1 的 66 分。这一分歧绝非无关紧要的方法学注脚,它触及了行业当前如何解读前沿进展的核心。
对试图理解这一分歧的读者来说,最简单的解释是,这些基准套件强调的重点不同。一个广泛的综合指标可能会奖励在大量任务上的稳定提升,而另一个则可能更严厉地惩罚在知识检索、编码或长上下文理解等特定领域中的较弱表现。因此,同一个模型在一套框架中可以像决定性的领先者,而在另一套框架中却只像是横向移动。
效率或许才是更重要的信号
这份报告中更引人注目的说法,不只是原始分数的位次,而是效率。The Decoder 表示,Astra 只用了 Sol 大约三分之一的计算步骤,以及 Opus 5 的五分之一。在编码任务上,Artificial Analysis 据称发现 Astra 的得分与 Claude Fable 5 持平,但单任务成本不到后者的一半。这样的结果之所以重要,是因为前沿竞争不再只是看谁能给出最优答案,而是看模型能以多么经济的方式达到那个答案。
这种区别在模型定价上更加明显。OpenAI 据称对 Astra 按处理文本单位收取的费用是 Sol 的 2.5 倍,使得一项任务的成本比此前高出约 75%。表面上看,这似乎意味着成本大幅上升。但 The Decoder 的说法暗示,Astra 在算力上的节省,会随着对手不同而改变比较结果。与自身前代相比,Astra 显得更贵;但与那些消耗更多计算的竞争模型相比,它在某些工作负载上仍可能显得相对高效。
从实践角度看,这就是前沿市场新的张力所在。一个模型即使在 API 价格上更贵,只要它能用更少的推理步骤、更低的 token 消耗,或在高价值任务上有更高的成功率完成工作,仍然可能提升价值。对开发者和企业买家来说,这些权衡很可能比任何单一排行榜位置都更重要。
ARC-AGI-3 改变了讨论方向
报告中最抓人眼球的结果来自 ARC-AGI-3,这是一个围绕陌生游戏世界构建的基准。在那里,GPT-6 Astra 据称达到了 62.7%,远高于 Sol 的 7.8%,也明显领先 Opus 5 的 30.2%。文章称,Astra 首次在该测试中比人类平均水平更高效。ARC Prize 负责人 François Chollet 据描述认为,这一进展速度大约是他预期的两倍,并将自己的 AGI 预测时间提前了。
即便如此,这种表述背后的更大意义,也不在于某个戏剧性的百分比本身,而在于它奖励的是何种能力。ARC 风格的评测旨在考察抽象能力和适应能力,而不是简单记忆。若表现强劲,其象征意义很强,因为人们往往会把这类结果视为模型在处理陌生结构方面变强的证据,而不仅仅是复现训练中见过的模式。
不过,同一份材料也明确显示,Astra 并非在所有方面都更强。Artificial Analysis 据称显示,该模型在 GDPval-AA v2 上大约失去 80 个 Elo 分,并在银行支持、SciCode 以及长上下文推理任务上出现下滑。这种不均衡的表现很重要。它表明,Astra 可能是一个更有针对性、或优化得更激进的系统,而不是在每个维度上都均匀提升。
输出更干净,但收益并不均衡
Astra 更实用的改进之一,或许是幻觉率下降。在 AA-Omniscience 上,The Decoder 报告其幻觉率从 92% 降至 51%。这仍然是一个相当高的幻觉率,但这一变化已经大到足以在那些无依据断言会带来风险的工作流中产生实际影响。对应用型 AI 团队而言,这类下降可能比排行榜上微小的位次变化更有价值,尤其是在研究、编码和商业决策支持等可靠性决定采用与否的场景中。
报告还提到,该模型在一项困难数学基准上表现罕见。Epoch AI 表示,Astra 是唯一一个在 300 美元单次尝试预算下,用 Lean 验证证明解决 68 个开放 FrontierMath Erdős 问题中的两个的模型。另有三项解答出现在额外的、非标准化运行中,这些运行消耗了超过 22 万美元的算力,但这些结果不计入得分。这个注释至关重要。它既展示了模型潜力的上限,也说明了在公平比较系统时,受成本约束的评测为何如此重要。
一次暴露排行榜思维局限性的模型发布
因此,Astra 的早期图景既不是简单的炒作,也不是直白的失望。它是一个案例,说明为什么前沿 AI 的评测已经很难压缩成单一排名。一套基准家族说 Astra 是领跑者,另一套则说它整体上只是与前代持平。一项推理基准则暗示,它在高效解决问题方面有着异常重要的飞跃。任务级指标显示,它在编码经济性和减少幻觉方面有所提升,但在其他领域也出现回退。
这种复杂性或许才是真正的故事。随着模型日趋成熟,行业正在告别一个时代,即一个头条分数就能代表整体能力。GPT-6 Astra 看起来像是一个其意义体现在选择性进展上的模型,尤其是在效率和某些抽象推理形式上,而非全方位统治。对于买家、研究者和竞争对手而言,这让它比一次干净利落的胜利更有看头,因为它暗示了 AI 竞赛下一阶段真正可能决定胜负的地方。
本文基于 The Decoder 的报道。阅读原文。
Originally published on the-decoder.com



