OpenAI将一次重大模型发布与异常宏大的主张捆绑在一起

OpenAI发布GPT-6 Astra,被描述的已不只是又一款更强大的前沿模型。根据所提供的原文,公司高层正将Astra塑造成一个足够重要的系统,足以重新引发一个问题:人工通用智能是否实际上已经到来,至少按照OpenAI自己的定义是如此。

公司将Astra描述为迄今最强大的模型,在预训练、强化学习和安全护栏方面都有进展。总裁Greg Brockman进一步表示,当人们回顾并追问AGI究竟何时到来时,他们或许会把这一时刻和这个模型视为答案。这对于一家多年来一直在描述迈向更通用AI的进展、却避免作出明确公开宣告的公司来说,是一次明显升级的表述。

这次发布的信息之所以重要,是因为它把产品推出、基准测试领先的主张,以及OpenAI如今对其系统能力的更大范围战略判断结合在了一起。Astra不只是被包装成更好的聊天机器人或编程模型。它被定位为面向专业工作、软件任务、计算机操作、浏览器操作,以及跨多种格式的风格化内容生成的系统。

基准测试结果是公司论证的核心

原始材料强调,基准测试表现是OpenAI论证的支柱。Astra据称在逻辑、数学、软件工程、网络安全、科学和专业工作等方面,表现优于前代模型GPT-5.6 Sol以及竞争对手的前沿模型。在所提供的报道中,OpenAI特别强调了ARC-AGI-3、DeepSWE、GPQA Diamond、BenchCAD和ExploitBench等测试中的强劲成绩,其中一些评测甚至接近满分或达到满分。

这些数字在此次发布中承担着双重作用。首先,它们支撑了公司关于Astra是其最高性能模型的商业主张。其次,它们也为更宏大的AGI时代叙事提供依据,暗示其提升横跨多个具有经济价值的领域,而不是只在某一专门方向上出现窄幅跃升。

OpenAI还表示,训练Astra使用了超过10万块GPU,研究副总裁Aidan Clark称这是公司有史以来规模最大的训练任务。这一细节进一步强化了Astra并非例行模型更新,而是一次跨越式发布的印象。

不过,即使在公司的叙述框架内,基准测试胜利也只是故事的一部分。更关键的说法是,这些能力能够转化为对真实界面和数字任务的实际工作。这正是公司强调计算机使用和代理式执行的重要原因。

Astra被包装成会做事的模型,而不仅仅是会回答问题

根据所提供的文本,Astra可以处理填写表格、更新客户关系管理记录、开展研究、起草摘要、分析数据、构建网站、运行前端质量保障检查,以及排查屏幕上的问题等任务。OpenAI还表示,该模型在完成桌面任务方面正确率高于Sol,而所用时间大约只有后者的一半。

这种准确性与速度的结合,对于公司定义进步的方式至关重要。一个只能生成高质量文本或代码样本的模型虽然有用,但能够操作界面、在浏览器中工作并执行多步骤流程的模型,开始更像一个数字员工。原文还提到,一个被描述为让模型像代理一样工作的软件与编排层新框架,使Codex编程代理完成网页任务的速度提升了1.9倍。

在原文引用的演示中,Astra布局了一块电路板,搭建了一个商业仪表盘,还在浏览器里根据W-2表格填写了联邦税表。这些例子意在展示的不仅是推理能力,还有其在技术、商业和行政场景中的任务完成能力。

公司也在将Astra定位为其最适合遵循模板、并生成与用户写作和视觉风格相匹配的幻灯片、文档和电子表格的模型。另一项被提及的改进是更好地筛选仅相关的上下文,这一说法直指企业用户对大型模型的一个常见抱怨:它们可以访问大量信息,但并不总能清晰地区分哪些信息应该影响输出。

推出策略体现了信心与谨慎并存

OpenAI并未一次性向所有人开放Astra。所提供的报道指出,该模型先向一小部分组织逐步开放,随后在接下来的几天里面向ChatGPT Plus、Pro、Business和Enterprise用户推出,同时也会通过API以及包括Amazon Web Services在内的云平台提供。企业管理员必须手动为其工作区启用Astra,发布初期默认关闭访问权限。

这种分阶段发布表明了一种熟悉的前沿AI模式:积极的公开宣传,配合受控部署。公司可能将其呈现为迄今最智能、也最安全的模型,但访问方式说明,如何将新能力引入真实客户环境,依然存在持续的谨慎。

定价也是竞争叙事的一部分。所提供的一份来源指出,token价格比前代高出2.5倍,且大致与一家领先的Anthropic模型持平;不过OpenAI认为,按完成任务的成本来算,在某些使用场景下仍可能更低。这种逻辑与Astra的产品定位相符。如果一个模型能在更少监督、更少重试的情况下完成更复杂的工作,那么按token计算的标价就只是价值衡量方式之一。

更大的意义在于战略,而不仅是技术

Astra的发布落在一个市场中,前沿模型开发者竞争的已不仅是原始智能,还包括谁能定义下一代计算界面。原文清楚表明,OpenAI希望Astra代表一个汇合点:更强的推理能力、更好的软件工程能力、更广泛的专业用途,以及更自主的计算机使用。

这一战略中最激进的部分是AGI叙事。通过将Astra与“AI能够在大多数具有经济价值的工作上超越人类”这一想法联系起来,OpenAI是在邀请公众把这款模型不仅视为一个技术系统,也视为经济和制度变迁中的一个里程碑。这提高了企业、开发者、监管者和竞争对手解读此次发布的门槛与分量。

所提供文本本身并不能独立证明AGI标签是否成立。它们能证明的是,OpenAI现在愿意公开把自己的最新模型锚定在这一门槛上,而这在此前并不常见。就实际意义而言,Astra似乎是公司迄今最明确的一次尝试,试图把前沿基准测试与真实任务执行结合起来,然后主张这一组合标志着行业进入了新阶段。

如果这一论点获得认可,Astra不仅会因其分数和演示被记住,也会因为它帮助推动了讨论重心从更聪明的模型转向可部署的机器劳动力。如果没有,这次发布仍将成为证据,表明前沿AI竞赛已经进入一个新的修辞和商业阶段。在这个阶段,主张不再只是模型在进步,而是它们正在逼近广泛有用的自主工作水平。

本文基于The Decoder的报道。阅读原文

Originally published on the-decoder.com