一张图站在 AI 泡沫争论的中心
在关于人工智能是否过热的争论中流传的所有图表里,有一张已经成了某种罗夏测试:一条显示 OpenRouter 每周 token 消耗量从 2025 年 1 月的约 0.5 万亿攀升至 126.2 万亿的曲线——增幅超过 25,000%。繁荣论的支持者指着这条近乎垂直的斜率,作为需求真实且正在加速的证据。怀疑者则看到的是一项被包装成行业指标的虚荣指标。
两种解读都值得审视。根据 Matthias Bastian 发表并在 LinkedIn 上被重点推介的分析,OpenRouter 这条曲线与其说是一个关于大规模采用或经济价值的故事,不如说是一个关于测量方式的故事。
OpenRouter 测量了什么——以及没有测量什么
OpenRouter 是一个路由层:开发者用它把应用程序连接到来自多家提供商的一系列 AI 模型,并常常根据价格、速度或能力在它们之间切换。这使得其使用数据确实很有意思,因为它捕捉的是生产流量,而非基准测试分数。token 是 AI 计算的基本单位——大致相当于汽车的加仑燃油,或公用事业计费的一个工作单位。
问题在于,token 并不能替代用户、会话或收入。一个平台可以在服务大致相同数量用户的同时处理多得多的 token,仅仅因为现在每个请求消耗的计算量要大得多。体量与价值之间的这道鸿沟,正是泡沫争论的关键所在。
为什么 token 计数膨胀得如此之快
推理模型会出声思考
现代推理模型在给出最终答案之前,会生成大量内部“思考”token。这些 token 对最终用户不可见,而且往往对输出质量的感知毫无贡献,却会被完整计入。与用更简单的模型回答同一提示相比,一个长时间斟酌的模型可能使 token 消耗增加数倍。
智能体系统大量消耗 token
未经优化的智能体 AI 系统会进一步放大这种效应。一个会规划、调用工具、检查结果并重试的智能体,可能为单个任务循环执行多次模型调用。现实使用量的边际增长——多运行几个智能体、工作流稍微长一点——就可能转化为 token 消耗的巨幅飙升。从这个意义上说,OpenRouter 的图表部分反映了某些部署目前仍有多么低效。

排行榜陷阱:GPT 5.6 Luna 的主导地位
该平台上的模型排名也会招致类似的误读。OpenAI 的 GPT 5.6 Luna 最近在 OpenRouter 上的 token 消耗中占据主导,这很容易被解读为人气飙升。但事实可能并非如此。一个模型仅仅因为每个提示生成更多 token,就能登上 token 排行榜榜首,从而显得比实际更繁忙。消耗排名衡量的是冗长度和工作量,而不只是采用情况。
不如去看收入
在 token 体量含义模糊的地方,支出更难造假。在收入方面,OpenAI 的 Astra 领先,表明客户愿意为市场顶端的强大能力付费。与此同时,包括 Kimi、GLM 和 DeepSeek 在内的中国模型正在快速扩张:2026 年这些模型的月度支出增长了十倍,尽管基数要小得多。从低起点出发的增长率往往看起来惊人,当这些数字被用作更广泛转变的证据时,这一背景很重要。
如何读懂 token 图表而不被误导
token 指标是有用的,但只有与正确的问题搭配时才有用:
- 体量与价值。 要问 token 背后对应的是多少收入或完成了多少任务,而不只是处理了多少 token。
- 每请求 token 数。 消耗上升可能来自更长的推理,而非更多请求。
- 模型组合。 单个冗长的模型进入榜首,就可能在不改变底层需求的情况下使曲线弯曲。
- 智能体开销。 重试、工具调用和规划循环会抬高计数,并可能掩盖低效。
- 基数效应。 十倍增长听起来非同寻常,直到你注意到它从哪里开始。
泡沫问题仍悬而未决
这一切并不意味着这波激增毫无意义。每周 token 从 0.5 万亿跃升至 126.2 万亿,表明大量 AI 工作正在完成,也表明开发者正在通过一个共享平台路由真实流量。它表明推理支出正在规模化。但图表上一条令人印象深刻的曲线,无法区分高效增长与昂贵扩张,也无法区分数百万用户与少数几个吞噬 token 的智能体。
最诚实的结论是:这张图描述的是计算成本,而不是市场状况。AI 泡沫之争将由收入、留存和回报来定论——这些正是 token 计数想要近似却无法替代的衡量标准。
本文基于 The Decoder 的报道。阅读原文。
Originally published on the-decoder.com



