万亿语料喂出的3.3亿参数预测器,谷歌正在蹲守一个被低估的赛道

2026.09.01 16:14
2026年8月31日,谷歌发布TimesFM-3时间序列基础模型,参数3.3亿,预训练语料超1万亿时间点,首次实现原生多变量零样本预测。双注意力机制与连续补丁掩码技术让所有预测在一次前向传播中完成,无需任务微调。这一发布标志着时间序列预测正从定制化建模走向开箱即用的基础能力,对Google Cloud的战略意义不亚于任何大语言模型。

2026年8月31日,谷歌研究团队在官方博客上放出了TimesFM-3的模型权重和论文。没有发布会,没有铺天盖地的PR稿件,中文科技媒体的报道寥寥。但在时间序列预测这个年产值数百亿美元、长期被ARIMA和Prophet统治的赛道上,这个模型正在悄然完成一次底层基础设施的替代。

它叫TimesFM-3,参数量3.3亿,预训练语料超过1万亿个时间点。但相比这些数字,真正值得关注的核心事实只有一个:这是第一个原生支持多变量零样本预测的时间序列基础模型。你不需要为每个预测场景单独训练模型,不需要数据科学家团队,甚至不需要调参——把一段包含多个相关序列的数据扔进去,它就能一次性输出所有预测结果。

时间序列预测的iPhone时刻

时间序列预测是一个被长期低估的刚需市场。

每一家连锁零售企业都在做销售预测,每一家工厂都在做设备故障预测,每一家金融机构都在做风险预测。但它们使用的工具,绝大多数还是几十年前的老方法:ARIMA(自回归移动平均模型,1970年代提出)、Prophet(Facebook 2017年开源)、指数平滑法。这些方法胜在稳定、可解释、不需要GPU,但它们有共同的天花板——每个预测场景都需要单独调参,而且几乎无法有效处理多个相关序列之间的依赖关系。

2024年,谷歌发布TimesFM 1.0,一个200M参数的纯解码器Transformer,用1000亿时间点预训练,首次证明了“一个时间序列模型预测所有场景”的可能性。2025年,TimesFM 2.0将参数量提升到500M,2.5版本又压缩回200M,同时引入16K上下文窗口和连续分位数预测,并在GitHub Trending登顶第一。2026年8月31日,TimesFM-3登场——参数量增至3.3亿,比2.5增加了65%,预训练语料从“未公开”直接跳到“超过1万亿时间点”。

从1.0到3.0,不到三年时间,谷歌完成了一个关键跨越:从单变量零样本,到原生多变量零样本。

关键变化一目了然:预测模式从单变量变为原生多变量(单前向一次完成);协变量支持从后加的XReg变为原生支持历史协变量加动态协变量;预测方式从逐补丁自回归变为连续补丁掩码单前向;分位数输出从连续分位数头变为9个分位数(10th到90th百分位);而许可协议也从Apache 2.0换成了新的TimesFM非商业许可v1.0。这些变化合在一起,指向一个清晰的方向——谷歌要把时间序列预测从专家工具变成基础设施。

一次前向传播,抹平所有等待

TimesFM-3最核心的技术突破并非“支持多变量”本身——毕竟亚马逊Chronos-2和Salesforce Moirai 2.0都已经做到了这一点。真正的杀手锏是:如何在一次前向传播中完成所有序列的联合预测。

此前所有TimesFM版本采用逐补丁自回归生成。流程是:模型预测出第一个未来补丁,把预测结果作为输入,再预测下一个补丁,循环往复。这套机制有两个根本性问题——计算延迟随预测窗口线性增长,误差逐级累积。第一个补丁的微小偏差,到最后一个补丁可能已经叠加到不可接受的程度。

TimesFM-3用Contiguous Patch Masking(连续补丁掩码)彻底推翻了这套流程。在输入阶段,模型把未来预测窗口的所有位置都用掩码占位符填充。目标和历史协变量序列的未来段全部被遮住,但过去-未来协变量(比如已知的促销排期、天气预报)保持可见。然后,通过交替注意力深层网络,模型一次性填满所有被掩码的未来补丁——没有循环,没有迭代,一次前向传播全部完成。

对于零售连锁的数千个SKU预测,或者工厂里上百个传感器的协同监测,预测时间从分钟级压缩到秒级,且不存在误差累积。

谷歌研究团队在博客中展示了一个冰淇淋销量预测的对比案例:不使用促销协变量的单变量模型只能看到历史销量的周度波动;而TimesFM-3的多变量模式把促销计划作为协变量传入后,模型不仅学会了促销与销量之间的关联机制,还能在新的促销日期上精确预测销量峰值。这个例子的核心信息很明确——不是因为模型有多大,而是因为它看到了单变量模型看不到的东西。

双注意力机制:织一张二维网格

TimesFM-3的交替注意力机制是整个模型架构的灵魂。它把输入数据组织成一个2D网格,横轴是时间,纵轴是不同的演化序列。在这个网格上运行两种注意力。

因果时间注意力:每个token只在自己的时序序列中沿时间方向看向过去,严格因果,不能偷看未来。这保证了每个序列内部的时间依赖关系被独立且准确地建模。

全变量注意力:在同一时间步上,每个token可以看向所有其他序列。这使得跨序列依赖关系可以被端到端学习——比如冰激凌A的促销降低了冰激凌B的销量,或者某工厂车间一条产线停机导致另一条产线的负荷上升。

两种注意力交替堆叠20层(模型维度1280,16个注意力头),让时序模式和跨序列关系在同一模型中自然融合。更巧妙的是对过去-未来协变量的处理:每个token不仅包含当前补丁,还拼接了未来补丁的信息——因为模型已经知道下周有促销,它不需要猜,所以预测更准。

在笔者看来,这一设计的深层意义在于:它让模型的行为逻辑逼近人类分析师的思维——同时观察多个指标的变化及其相互关系,而不是对每个时序逐个分析之后再手工汇总。区别在于,模型能在几毫秒内完成一个人类分析师需要几个小时甚至几天的工作。

开源引流,云上变现:谷歌的时序布局

当前时间序列基础模型赛道的玩家格局已经清晰成形。

谷歌TimesFM-3,配上一份名为TimesFM非商业许可v1.0的新协议。核心约束:禁止在生产系统中自托管商用。如果你想把TimesFM-3用于商业场景,要么走Google Cloud的托管路径(BigQuery ML、Vertex AI),要么直接找谷歌谈商业授权。这是一个标准的开源心智占领、云服务变现策略——TimesFM系列已经在GitHub上累积数万Star,开发者社区生态已经建立,现在通过许可条款将商业价值导向自家云平台。

亚马逊Chronos-2,基于T5架构,支持多变量预测,开源许可(Apache 2.0),紧密集成AWS生态。亚马逊在许可上比谷歌宽松得多——你可以把Chronos-2部署在任何地方。

Salesforce Moirai 2.0,采用MoE(混合专家)架构,同样支持多变量预测,开源许可。

一个有趣的格局分化正在形成:谷歌在技术上走得更远(单前向预测、交替注意力),但在许可上收得更紧;亚马逊和Salesforce在技术上跟进,但在许可上保持开放。对于企业用户来说,选择哪条路线不再只是技术问题——它同时是云策略和合规预算的决策。

值得注意的是,TimesFM-3已经接入了BigQuery ML。这意味着数亿SQL用户可以直接用熟悉的查询语法调用这个零样本预测引擎。对于Google Cloud来说,这是一颗极具杀伤力的棋子——它让传统的SQL分析师也能做专业级的时间序列预测,而不需要雇佣机器学习工程师。

谁真正需要TimesFM-3

零售供应链是最直接的应用场景。一个连锁便利店可能有数千个SKU乘以数百个门店的海量销售序列,再加上促销、天气、节假日等协变量。以前要么每个序列单独建模(成本高到不可接受),要么用简单的统计方法(精度严重不足)。TimesFM-3用一次前向传播处理所有序列,同时捕捉跨SKU的替代和互补关系。

金融领域的多资产风险预测同样是天然的多变量问题。股票A和股票B之间的相关性、利率变化对资产组合的影响,都需要联合建模而非单独预测。

制造业的设备预测性维护涉及多个传感器(温度、振动、压力)的协同建模,也是TimesFM-3的天然战场。

但需要正视它的局限。如果时间序列有极强的领域特殊性——比如高频金融交易数据、脑电信号——零样本预测可能不够精准。在受监管行业(银行、保险),非商业许可的合规路径需要谨慎评估。此外,330M参数虽然和动辄百亿参数的大语言模型相比很小,对完全没有GPU基础设施的团队来说,仍然是额外的部署成本。

拐点已至

TimesFM-3的发布标志着时间序列预测正在经历一个关键拐点。不是技术本身的惊天动地,而是它让过去只有专家和数据团队才能做的事情,变成了普通数据分析师甚至SQL用户可用的工具。

3.3亿参数、1万亿时间点的预训练、一次前向传播完成多变量预测——这些技术指标背后是一个更本质的变化:时间序列预测正在从定制化建模走向开箱即用的基础能力。就像当年的云数据库让企业不再需要自建MySQL集群,TimesFM-3正在做的事是让企业不再需要自建预测模型。

对于Google Cloud,TimesFM-3直接提升了BigQuery ML的不可替代性。对于中小型企业的数据团队,一名数据分析师结合BigQuery和TimesFM-3的组合,可以覆盖大多数预测场景。而对于传统的时序预测SaaS厂商——DataRobot、Alteryx——压力是真实的。当一个开源基础模型能以零样本模式击败需要数月建模的传统方案时,预测模型本身的商业价值正在被加速侵蚀。

至于亚马逊Chronos-2和Salesforce Moirai 2.0,它们需要在技术上快速跟进原生多变量加单前向能力,同时在开源许可上继续保持对比优势。竞争才刚刚开始。

从单变量到多变量,从自回归到单前向,从定制建模到零样本——时间序列预测的最后一块专家门槛,正在被一次前向传播彻底抹平。

作品声明:内容由AI生成