Google 的 TimesFM-3 超越曲线本身

Google Research 推出了 TimesFM-3,这是一个预测模型,旨在预测时间序列中的未来值——那些以每日销售额、交通流量或传感器读数形式出现的有序数字流——同时权衡围绕这些数字的上下文。此次发布标志着将预测转变为通用能力而非为每个数据集重建的定制工程项目的努力又迈出了一步。

其核心前提是,真实的预测很少仅依赖于单一变量。Google 用一家试图预测冰淇淋销量的零售连锁店来说明这一点。一个只看过去冰淇淋购买量的模型会错过很多信息:相关商品(如华夫筒和糖浆)的销量、商店附近的历史人流量、天气状况、计划中的折扣活动和节假日都会影响需求。TimesFM-3 旨在将这些信号整合到一个预测中,而不是将每个信号视为单独的问题。

分块、归一化和双向 Transformer

在架构上,TimesFM-3 仍属于 Transformer 家族,与其前身使用相同的基础设计。但它在时间序列数据如何进入网络方面做出了刻意的选择。它不是一次向模型输入一个数据点,而是将 32 个连续点分组为一个分块(patch)。该分块成为模型推理的单元,从而缩短了序列,并让网络对局部形态有更广阔的视野。

Google 还将每个序列归一化到共同尺度。这一点很重要,因为时间序列的量级差异极大——每天售出的少量单位与工业传感器数百万的读数——直接比较它们将毫无意义。将每个序列缩放到共享基线,使模型能够将来自截然不同领域的模式视为可比较的。

处理随后沿两个交替方向进行。沿时间轴,模型在单个序列内寻找模式,并且只利用过去的值,以免未来信息泄漏到预测中。跨序列,它比较给定时刻的每个变量,并学习它们之间的关系。这种跨序列视角使模型能够捕捉到诸如一个产品的折扣改变另一个产品销量等效应——这是单序列模型永远无法观察到的关系。

TimesFM-3 的架构图,显示四个时间序列,每个分块包含 32 个点,一个由因果时间注意力和完整变量注意力组成的 token 网格,以及预测的目标序列 T1 和 T2。
蓝色标记目标序列,紫色表示仅历史已知的变量,绿色表示已知的未来事件,其 token 已包含即将到来的分块。| 图片:Google

Google 对输入设置的图示用颜色编码了数据:蓝色目标序列、仅从历史中已知的紫色变量,以及已知未来事件的绿色 token,其表示已包含即将到来的分块。

三类额外信号

据 Google 称,TimesFM-3 接受三种不同类型的补充数据。

  • 它联合预测的协变量。该模型可以同时预测多个相关变量,例如不同冰淇淋口味的需求,而不是孤立地处理每一个。
  • 历史已知变量。诸如过去人流量等因素可获取到当前,但无法获取未来,模型将其作为上下文纳入。
  • 已知的未来事件。计划中的促销、折扣时间表和天气预报是时间安排已经已知的事件,因此模型可以将它们用作前瞻性输入,而不是仅从历史中推断。

第三类正是 TimesFM-3 与经典统计预测分歧最大的地方。促销日历不是等待被发现的模式——它是关于未来的事实。该模型被设计为接受此类事实作为输入。

一次性预测而非逐步预测

该模型的早期版本一次生成一个块的预测。每个新块都建立在前一个预测之上,Google 将这种方法描述为缓慢、计算密集且容易累积误差:序列早期的一个小错误可能会扭曲后续的一切。这是自回归预测中常见的失败模式,模型实际上以自己的输出为食。

TimesFM-3 放弃了这一循环。它为每个未来时间步骤分配空白占位符,并一次性完成它们。Google 将其称为一次性预测,实际差异在冰淇淋场景中显现出来。一个只知道过去销量的模型只会延续既定的每周节奏,对尚未发生的促销视而不见。一旦 TimesFM-3 收到折扣时间表,它就可以在一次传递中调整预测,而不是逐步向前推进。

每步九个值:内置不确定性

TimesFM-3 不是为每个时间步骤输出单一的点估计,而是每步输出九个值。这些值旨在捕捉预测的范围和不确定性——这种预测不仅传达可能发生什么,还传达模型有多自信。对于规划目的而言,这种区别通常比一个单纯的数字更有用,因为它让下游系统能够推理风险、缓冲库存或备用容量。

Gift-Eval 基准的散点图,显示点预测和概率预测的平均排名;TimesFM-3 以橙色显示在左下角,领先于 Chronos-2、Toto-2.0、TiRex-2 和 TimesFM-2.5。
左下角更好。TimesFM-3 在 Gift-Eval 上大幅领先,即使仅限于单个变量。| 图片:Google

万亿点规模训练,零样本部署

据 Google 称,该模型拥有 3.3 亿个参数,并在总计超过一万亿个数据点的真实和合成时间序列混合数据上进行了训练。与其前身一样,它以零样本方式运行:新任务无需额外训练。这一特性是其卖点的核心。从业者无需为每个新的预测问题组装标记数据集并拟合模型,而是可以将 TimesFM-3 指向一个序列及其相关信号,并期望获得可用的输出。

零样本性能也是基础模型方法在预测领域具有吸引力的首要原因。预测问题无处不在——库存、能源负荷、人员配置、物流、容量规划——但每个问题历史上都需要自己的流程、自己的特征和自己的验证机制。一个能够跨这些问题泛化的单一模型改变了谁能构建预测系统以及构建速度。

训练数据的广度在这里与参数数量同样重要。通过将合成序列与真实序列混合,Google 可以让模型接触到比任何单一领域所能提供的更广泛的形态、季节性节奏和冲击模式。这种多样性是泛化的原材料,也是零样本主张最终所依赖的基础。

对数字基础模型的更广泛押注

TimesFM-3 处于两大趋势的交汇点:基础模型超越文本和图像的扩展,以及对更好的运营预测的长期需求。Google 的框架是,上下文是将朴素外推与有用预测区分开来的关键,而架构正是对这一主张的直接回应——分块提高效率,归一化实现可比性,跨时间和变量的注意力捕捉关系,一次性解码器保证连贯性。

这种组合能否在混乱的真实世界数据中站得住脚,仍是一个悬而未决的问题,对任何零样本系统都是如此。但方向是明确的:预测正被视为一项通用推理任务,而非统计杂务,销售数据、天气和折扣日历都属于同一输入。对于开展促销的零售商、平衡负荷的公用事业公司和规划容量的运营商来说,吸引力显而易见——模型被要求预测日历上已经存在的事件,而不仅仅是延长去年的曲线。

本文基于 The Decoder 的报道。阅读原文

Originally published on the-decoder.com