Deepseek 以更强的 Flash 模型推动低成本 AI 竞争
Deepseek 发布了其预算型 AI 模型的更新版本 V4 Flash “0731”,而所附来源中引用的数据表明,低成本大语言模型之间的性价比竞争出现了明显变化。根据报道中引用的基准数据,该模型在 Artificial Analysis Intelligence Index 上提升了 10 分,达到 50 分。这使它只比 OpenAI 的 GPT-5.6 Luna 低 1 分,同时据同一来源称,其单任务成本约低 60%。
正是这种组合让此次发布显得格外重要。在 AI 市场中,前沿能力与低成本部署之间的差距,已经成为最重要的商业战场之一。一个模型不必在每项基准上都全面领先,也可能改变市场。如果它在质量上足够接近,同时大幅降低运行成本,就可能改变开发者的选择、企业采购决策,以及将 AI 产品扩展到高请求量场景时的经济结构。
为什么这次更新引人注目
所附报道将 V4 Flash “0731” 描述为一次重大升级,而不是一次小幅调优。该模型在 Artificial Analysis Intelligence Index 上的得分据称从 40 分升至 50 分,这对于一款已经定位在预算区间的模型来说,是相当可观的跃升。报道还称,与 2026 年 4 月推出的前一版本相比,它在所有测试类别中都有所改进。
最大幅度的提升出现在 agentic 任务上,这一类别尤其重要,因为许多实际 AI 部署正在从单轮聊天转向工具使用、工作流执行以及多步骤的持续辅助。如果一款低成本模型在这一领域缩小了差距,它就更有可能胜任真实的办公和运营工作负载,而不只是轻量级的消费者交互。
来源还提到该模型在 GDPval 上有所提升。GDPval 是一种用于测试模型在复杂现实办公工作中表现的基准。在这一项上,Deepseek V4 Flash “0731” 据称从 1,189 Elo 提升到 1,559 Elo。这个增幅在文章给出的框架内相当显著,也支持了这样一个更广泛的判断:这次更新并不只局限于某个狭窄的基准类别。
来源中提到的另一项实际改进是幻觉频率下降。对于开发者和采购方来说,这一点至少和原始基准分数同样重要。一个便宜但经常生成虚构答案的模型,往往在加入验证、重试逻辑和人工审核后反而变得昂贵。如果幻觉率在生产环境中确实更低,那么它会直接影响部署质量和总拥有成本。
经济性可能是更大的故事
价格是文章叙述中的核心。报道称,尽管 OpenAI 已将 Luna 的价格下调了 80%,Deepseek 的模型每个任务的成本仍比 OpenAI 的 GPT-5.6 Luna 低约 60%。报道还指出,Deepseek 提供了 98% 的缓存折扣,而行业标准为 90%,这是其优势的主要原因之一。此外,新模型据称比前代少使用 12% 的 token。
这些细节之所以重要,是因为 AI 经济越来越受使用模式影响,而不仅仅是标价。缓存折扣奖励重复提示和可预测工作流。较低的 token 使用量则同时降低成本和延迟。综合起来,这些因素会让一款模型在实际使用中看起来比单纯的输入输出价格对比所显示的便宜得多。

对于部署智能体、编码助手、搜索增强或内部知识工具的团队来说,这类定价结构可能会显著改变架构选择。一款在指数上略弱、但运行成本明显更低的模型,往往会成为高吞吐任务的默认主力,而把更昂贵的模型仅保留给最困难的情况。
开源权重和长上下文增加了压力
来源称,该架构保持不变,总参数为 2840 亿,其中 130 亿为激活参数,并支持 100 万 token 的上下文窗口。报道还指出,该模型权重已在 Hugging Face 上发布,采用 MIT 许可证。
这一组合强化了 Deepseek 的战略位置。长上下文窗口对文档密集型工作依然具有吸引力,而 MIT 许可证则降低了采用、实验和商业集成的门槛。在当前 AI 市场中,许可条款几乎和基准分数一样关键。宽松许可扩大了愿意围绕某个模型构建的公司和开发者范围,尤其是在预算敏感度已经很高的情况下。
Deepseek 在保持相同核心架构的同时仍取得了显著的基准提升,这一点如果属实,也释放出一个信号:优化努力究竟在哪些地方最有效。改进并不总是需要全新的模型家族。在某些情况下,训练更新、后训练方法和效率优化就足以带来足够大的跃升,从而重新定位一条既有产品线,与竞争对手抗衡。
这对市场意味着什么
更大的结论不是某个基准排行榜上分数只变了 1 分,而是 AI 的预算层正在变得更具竞争力、更有能力,也更具战略重要性。高端模型市场依然重要,但许多真实部署往往是在中间地带决出胜负,在那里,质量已经够用,而规模成本主导一切。
如果所附基准数据能够转化为更广泛的现实表现,Deepseek 将进一步证明自己是这一细分市场中的重要竞争者。来源明确将这次更新后的模型描述为在所引用指数上拿下了性价比榜首。对于注重成本的构建者,尤其是那些依赖大规模重复推理的系统设计者来说,这种定位具有很强的吸引力。
对于包括 OpenAI 在内的竞争对手来说,含义很直接:价格压力并没有减弱,而在更低成本下达到基准持平,可能会迅速改变人们围绕“哪一款模型是实际默认选择”的讨论。对于买家而言,这一发布再次提醒:AI 领域的重心不再只是看谁拥有最强旗舰模型,而是越来越看谁能以可扩展的价格提供可用的智能。
要点
- Deepseek 的 V4 Flash “0731” 据称在 Artificial Analysis Intelligence Index 上从 40 分升至 50 分。
- 来源称,该模型比 OpenAI 的 GPT-5.6 Luna 低 1 分,但每个任务的成本约低 60%。
- 在 agentic 任务、较低 token 使用量以及 98% 的缓存折扣方面的改进,增强了它在预算市场中的吸引力。
本文基于 The Decoder 的报道。阅读原文。
Originally published on the-decoder.com
