返回 文章 学习 CMS 文章

TimesFM-3:面向多变量预测的零样本基础模型

TimesFM-3 用单次前向传播完成多变量零样本预测,在三大公开基准上取得最优平均排名。

时间序列预测基础模型零样本学习多变量预测
成长分 / 100 80 综合收获、行动、留存与影响

TimesFM-3:面向多变量预测的零样本基础模型
为什么值得读了解时间序列基础模型从单变量到多变量预测的关键演进,以及 TimesFM-3 如何原生支持跨序列依赖与协变量。

掌握 TimesFM-3 的核心架构设计:连续 Patch 掩码、交替注意力机制与 9 分位数概率输出。

关键洞察
  1. TimesFM-3 拥有 3.3 亿参数,在超过 1 万亿个时间点的真实与合成时间序列语料上预训练,原生支持多变量预测。
  2. 模型采用连续 Patch 掩码策略,在单次前向传播中生成整个预测视野,避免迭代循环带来的延迟与误差累积。
  3. 架构在仅解码器 transformer 基础上交替使用时间注意力与跨序列注意力,将时间模式与跨序列关系融合。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:7828

2026年8月31日

Ayush Jain 和 Rajat Sen,Google Research 研究科学家

我们推出 TimesFM-3,这是一种最先进的时间序列基础模型,能够在单次前向传播中实现高精度的多变量时间序列预测,在各大基准测试中显著优于其他预测模型。

自 2024 年 TimesFM 首次亮相以来,我们见证了时间序列基础模型在多个领域的真实世界时间序列预测任务中得到采用,例如零售、金融、可观测性、制造业、医疗保健和自然科学

直到 TimesFM-2.5(于 2025 年 9 月发布),我们的模型一直严格限于单变量预测:仅使用单个时间序列的历史进行预测。然而,大多数真实世界的预测问题本质上是多变量的:多个时间序列和辅助外部特征共同影响一个时间序列的未来预测。考虑为零售连锁店预测冰淇淋销量。仅凭过去的销量很少能说明全部情况。一个好的预测还应该利用相关产品的销量(例如,冰淇淋蛋筒、糖浆)、历史客流量以及已知的未来事件,如天气预报、促销活动和节假日。

今天我们推出 TimesFM-3,这是我们下一代时间序列基础模型,原生预训练用于多变量预测。TimesFM-3 拥有 3.3 亿参数,并在包含超过 1 万亿个时间点的真实世界和合成时间序列语料库上进行了预训练。基于其前代模型的效率和零样本泛化能力,TimesFM-3 以零样本方式增加了对复杂多变量场景的稳健支持。它可以联合预测多个共同演化的时间序列,捕捉能够提高整体准确性的依赖关系,而无需针对特定任务进行微调。该模型原生支持:

TimesFM-3 建立在其前代模型经过验证的仅解码器 transformer 架构之上。与之前版本一样,我们通过将连续数据点分组为 32 个时间步的补丁来高效处理时间序列。然后,我们像 TimesFM-2.5 那样对每个时间序列进行归一化,以应对尺度差异巨大的时间序列。

对于目标序列和过去协变量序列,一个 token 直接由单个补丁构建。然而,对于过去-未来协变量,TimesFM-3 采用了一种巧妙的“前瞻”策略:每个 token 将当前补丁与未来补丁拼接起来,使模型能够窥见即将到来的已知信号。

一旦补丁被 token 化,它们会经过一个输入残差块,然后进入主 transformer 堆栈,该堆栈以 2D 网格方式运行:

这两种注意力机制在多个层中交替使用,将时间模式与跨序列关系无缝融合。

TimesFM-3 架构。

此前版本的 TimesFM 一次只生成一个 patch 的预测,这带来了延迟、误差累积的叠加以及计算成本。TimesFM-3 采用连续 Patch 掩码策略,在单次前向传播中生成整个预测视野。模型在观测到的上下文之外,为未来视野追加被掩码的占位 token。目标序列和过去协变量序列在预测视野中被掩码(因为它们的未来值未知),而过去–未来协变量保持可见,从而为模型提供已知的未来信号,如节假日或已排定的活动。通过交替注意力层,模型同时填充所有被掩码的视野 patch,无需迭代循环。模型对每个目标时间序列在预测视野的每一步预测 9 个分位数(从第 10 百分位到第 90 百分位),提供预测不确定性的完整概率视角。

让我们重新回顾冰淇淋销售的示例。假设你正在制定下个月的促销计划,并希望预测销量以便提前准备。标准的单变量模型(下图中的红线)查看历史销量并将周度模式向前外推——但它对特定日期已计划的促销一无所知。TimesFM-3 的多变量模式(下图中的蓝线)采取了不同的方法:通过将已计划的促销日程作为过去–未来协变量传入,模型从历史上下文中学习促销与销量提升之间的关系,然后将该知识应用到未来有促销计划的日期上。其结果是预测在每个促销日会出现约 20% 的销量提升。在下图中,促销协变量中的琥珀色块突出显示了哪些日期有促销——蓝色预测对每一个都明显作出响应,而红色预测则没有。在整个月内,这累积起来会得到更准确的预计收入预测。

规划促销:TimesFM-3 的多变量预测使用促销协变量来预判未来已计划促销日的销量提升。

我们在三个全面的公开预测基准上评估了 TimesFM-3:Gift-EvalFEV-BenchTime。在这三个基准上,在所有预训练基础模型中,TimesFM-3 在点预测和概率预测指标方面均排名第一。下图展示了三个基准上点预测准确性和概率预测质量(越低越好)在各任务上的平均排名。我们与近期的基础模型进行了比较,包括具备多变量能力的模型,如 Chronos-2 和 Toto 2.0 系列,以及我们此前的模型 TimesFM-2.5。

每个图中都包含 TimesFM-3 的两个条目。“单变量模式”条目展示的是模型在没有任何协变量或跨序列信息的情况下进行评估时的性能,即像传统单变量模型一样独立处理每个目标序列。即使在这种单变量模式下,TimesFM-3 也已经与其他竞争模型持平或更优。当我们切换到完整的多变量模式时,TimesFM-3 又实现了一次跃升,在点预测和概率预测两方面全面取得了最佳平均排名。

在 Gift-Eval()、Fev-Bench()和 Time()上的表现:TimesFM-3 在单变量模式下,其点预测和概率预测指标均已超越其他可复现的时间序列基础模型。多变量模式在可用时利用跨序列信息和协变量,进一步提升性能。

我们推出 TimesFM-3,这是我们 TimesFM 系列零样本时间序列基础模型的最新一代,在多个公开基准上取得了最先进的多变量和单变量预测性能。TimesFM-3 现已在 GitHubHugging Face 上提供,其 BigQuery 集成将在未来几周内上线。在此期间,您可以立即在单变量任务上试用 TimesFM-2.5,以熟悉 BigQuery 中的 AI.FORECAST 命令——无需任何机器学习专业知识。

本项目是与 Yichen Zhou、Petros Mol、Abhimanyu Das 和 Samet Oymak 的合作成果。