Thinking Machines 正在为更小型推理模型辩护

由前 OpenAI CTO Mira Murati 创办的 AI 实验室 Thinking Machines 发布了 Inkling Small,这是一款开放权重推理模型,旨在以更小的活跃参数规模竞争能力表现,而非沿用公司更早的 Inkling 模型那样更大的体量。此次发布传递出一个熟悉但在 AI 市场中日益重要的信号:效率正在成为一项产品特性,而不仅仅是技术注脚。

根据所提供的原始文本,Artificial Analysis 给予 Inkling Small 在其 Intelligence Index 上 40 分,仅比 Inkling 的 41 分低 1 分。这个差距小到足以让标题一目了然。新模型被定位为一个更小的系统,在提升部分编码与推理基准表现的同时,整体接近更大模型的水平。

该模型的规模特征是其核心卖点。文中称 Inkling Small 拥有 2760 亿总参数和 120 亿活跃参数,来源还表示这不到原始 Inkling 规模的三分之一。Artificial Analysis 还表示,没有同等或更小规模的开放模型能在其指数上取得更高分数。

基准结果显示出有针对性的提升

基准故事并不只是 Inkling Small 在整体上与前代几乎同样强。原文称,它在若干编码和推理测试中表现优于更大的 Inkling。举例包括 Humanity’s Last Exam,Inkling Small 得分 32%,而 Inkling 为 30%;以及 GPQA Diamond,Inkling Small 达到 89%,Inkling 为 87%。

这些数字之所以重要,是因为它们表明该模型并非只是压缩版,保留了大部分能力。在至少一些任务上,它似乎能够超越更大的系统。在一个长期将更大模型视为更高性能默认路径的市场中,这样的结果颇具意义。

与此同时,原文并未将 Inkling Small 描述为全面升级。报道称,它在基于智能体的任务和事实知识方面落后于原始 Inkling。这个限制很重要,因为它让这次发布停留在取舍而非炒作上。对于更强自主任务执行或更广泛知识召回有需求的用户来说,即使小模型在效率上更有吸引力,他们可能仍会偏好更大的模型。

效率才是更深层的竞争信息

更强的差异化因素可能是 token 效率。原文称,Inkling Small 平均每个任务输出 24000 个 tokens,而 Deepseek V4 Flash 为 45000 个,GPT-5.4 mini 为 78000 个。表面上看,这意味着该模型可以用更少的输出内容完成大量推理工作,相比某些竞争系统更为节省。

这种效率对经济性和产品设计都很重要。更低的输出 token 使用量可以降低推理成本和延迟,并可能简化在吞吐量或预算与原始基准实力同等重要的环境中的部署。对于把 AI 功能嵌入产品的公司来说,一款能用更少输出 token 做更多事情的模型,即便它不是所有榜单的第一名,也会变得很有吸引力。

因此,这次发布指向了 AI 供应商定义进步方式的更广泛转变。开发者不再只强调绝对前沿性能,而是越来越多地围绕每 token 质量展开竞争。Inkling Small 符合这一趋势:根据所给数据,它在整体水平上接近更大的同类模型,同时改善了效率表现。

开放权重与多模态输入扩大了吸引力

Thinking Machines 还在努力扩展该模型的实际适用范围。原文称,Inkling Small 支持文本、图像和语音输入,并配有 256000 token 的上下文窗口。该模型以 Apache 2.0 许可证发布,权重托管在 Hugging Face 上。

这些细节很重要,因为它们决定了谁能使用该模型以及能多快将其改造。Apache 2.0 发布降低了实验和商业使用的门槛。多模态输入支持让该系统适用于比纯文本推理更广泛的应用场景。超长上下文窗口则提升了它在处理大型文档、长对话或大规模工作记忆任务中的吸引力。

原文还称,用户可以通过 Tinker Playground 在浏览器中对模型进行微调。这个功能与 Thinking Machines 将其模型定位为可基于用户自有数据进行定制的基础模型的策略一致。换句话说,公司售卖的不只是一个基础模型故事,而是一套用户可将该基础模型适配到更窄目标的工作流。

为何这次发布在当下模型市场中重要

Inkling Small 的到来,正值 AI 开发者面临展示实际价值而非仅仅展示规模的压力。训练越来越大的模型依然成本高昂,而部署这些模型的产品团队还必须同时权衡成本、速度、灵活性和许可,而不仅仅是能力。这为那些未必最大、也未必最全能,但在关键任务上足够好且运行更高效的模型留出了空间。

原文把 Inkling Small 描述为正是这种产品:一款更小的开放权重推理模型,却在同类中表现异常出色。如果这一定位在更广泛使用中成立,它可能会强化这样一种观点:模型开发正进入一个更克制的阶段,在这个阶段里,优化和部署价值与原始扩张同样重要。

这也持续把关注点放在市场中一个不断扩大的细分领域:可以微调并嵌入自定义工作流的开放模型。尽管专有前沿系统仍主导许多头条对比,但开放权重发布依然具有战略重要性,因为它们让组织能更直接地控制模型如何被适配、托管和治理。

这是一次克制的推进,而非极限式宣言

Inkling Small 最有意思的地方,或许在于它没有试图声称什么。根据所提供文本,Thinking Machines 并未把它包装成各项指标都最强的单一模型。相反,这次发布主张的是一个更窄、更务实的命题:在其规模下接近顶级表现,在部分基准上击败更大的同类模型,具备多模态能力、长上下文,以及明显更精简的输出 token 曲线。

这让这次发布更像一次工程优先级的表达,而不是一场表演。能够良好推理、保持开放、并减少 token 消耗的更小型活跃模型,在 AI 部署趋于成熟时大概率仍将具有吸引力。Inkling Small 显然是在押注这一未来。

它能否成为被广泛采用的基础模型,还要取决于本文所列摘要数据之外的真实世界测试。但就现有信息而言,战略信息已经很清楚:Thinking Machines 正试图证明,在 AI 领域,效率不再是妥协项,而正在成为一个严肃的竞争赛道。

本文基于 The Decoder 的报道。阅读原文

Originally published on the-decoder.com