引言

微软发布了MAI Code 1.1 Flash,这是一款专为GitHub Copilot设计的代码生成模型。该公司声称新模型能编写更好的代码,token效率提高25%,成本仅为6月前代的四分之一。然而,基准测试对比显示,该模型在价格和性能上均落后于DeepSeek的V4 Flash,引发了对微软在竞争激烈的AI领域定位的质疑。

性能基准

在内部基准测试中,MAI Code 1.1 Flash相比前代和一些竞争模型显示出适度改进。在SWE-bench Verified上,它得分72.6%,略高于MAI Code 1 Flash(71.6%)、Haiku 4.5(69.8%)和GPT-5.4 mini(69.2%)。然而,DeepSeek未公布该基准的得分。

在Terminal Bench 2.1上,结果更具说明性。MAI Code 1.1 Flash得分62.9%,较前代的51.7%和Haiku 4.5的49.4%有显著提升,但仍远低于DeepSeek V4 Flash的82.7%。这一差距表明DeepSeek的模型在实际编码任务中能力更强。

价格对比

微软将MAI Code 1.1 Flash定位为经济实惠的选择,但仔细比较价格后发现,它仍比DeepSeek的产品更贵。对于输入token,MAI Code 1.1 Flash每百万个收费0.20美元,而DeepSeek为0.14美元。使用缓存后,价格降至MAI的0.02美元和DeepSeek的0.0028美元。输出token的差距更大:MAI每百万个收费1.20美元,而DeepSeek仅收费0.28美元。

这些价格显著低于Anthropic的Claude Haiku 4.5,后者输入收费1.00美元,缓存后0.10美元,输出5.00美元。然而,DeepSeek的定价大幅低于微软,使其成为注重成本的开发者的更具吸引力的选择。

Token效率与用户采用

微软声称MAI Code 1.1 Flash的token效率比前代提高25%,意味着生成相同输出所需的token更少。这种效率可能转化为用户成本的降低,但公司未提供详细数据说明如何转化为实际节省。

在用户采用方面,微软报告称,开发者对模型输出的接受度比前代提高了4%。此外,公司指出回访次数增加了9%,表明用户发现该模型更有用。然而,这些指标是相对于微软自身模型的,并未涉及与DeepSeek等竞争对手的比较。

训练与开发

微软使用“GitHub Copilot中数十万个强化学习环境”训练了MAI Code 1.1 Flash。这种方法利用真实编码场景来改进模型性能。公司未披露确切的训练数据或方法,但使用来自用户交互的强化学习是一个值得注意的策略。

战略影响

MAI Code 1.1 Flash的发布正值微软推动自身定位为开放AI倡导者之际。然而,公司投资于一个在价格和性能上均落后于DeepSeek等开放权重替代品的专有模型,似乎自相矛盾。微软多次表达对开放权重模型的赞赏,但其自身战略似乎偏向内部封闭解决方案。

可能的原因是削减成本。微软最近改组了Copilot产品,用更便宜的MAI替代品取代了OpenAI和Anthropic模型,以降低开支。代价是性能下降,但利润率提高。MAI Code 1.1 Flash符合这一模式:比前代便宜,但仍比DeepSeek贵,且性能更差。

GitHub Copilot生态系统中的微软客户仍可根据应用和用例选择不同模型。然而,微软可能会将自家模型设为默认选项,将用户锁定在竞争力较弱的解决方案中。这一策略可能会疏远优先考虑性能和成本的开发者。

结论

微软的MAI Code 1.1 Flash相比前代是渐进式改进,但在价格和性能上均无法与DeepSeek的V4 Flash竞争。公司对专有模型的关注与其公开的开放AI立场相矛盾,最终可能阻碍其在快速发展的AI市场中的竞争力。随着开发者日益寻求高性价比和高性能的解决方案,微软可能需要重新考虑其方法,否则将面临被更灵活的竞争对手超越的风险。

本文基于The Decoder的报道。阅读原文

Originally published on the-decoder.com