每周3美分,准确率飙两位数:迪卡侬用120M参数模型重写零售预测规则

2026.08.29 07:18
迪卡侬(Decathlon)在AWS上部署Chronos-2时间序列基础模型,在覆盖四大洲的数万种产品需求预测中实现WAPE降低11–15个百分点,每周推理成本约0.03美元——全部跑在CPU上。这个案例标志着AI基础模型在零售供应链场景中从概念验证进入生产级部署的关键转折。

207亿欧元的生意,押注在一个120M参数的模型上。

这不是某个AI独角兽的故事,而是全球最大体育用品零售商迪卡侬刚刚公开的生产级部署。2025年,迪卡侬的商品交易总额达到207亿欧元,全年卖出12.3亿件商品,覆盖80多项运动。每一件商品从工厂到货架的旅程,都依赖需求预测来决策:订多少货、备多少库存、分配到哪些区域。

过去,这套系统的核心是用定制模型每周重训。现在,迪卡侬换了一种思路——不再替每个产品量身定制预测模型,而是用一个预训练好的时间序列基础模型,在所有产品上统一做推理。结果在东南亚和拉丁美洲两个已投产的供应链区得到验证:12周补货窗口上的WAPE(加权绝对百分比误差)从39%降到28%(SEA)、从53%降到38%(LATAM),分别提升11和15个百分点。

更令人惊讶的是成本。每周一次的批量推理,跑在Amazon EC2 m6i.8xlarge(纯CPU实例)上,东南亚区域约15000条时间序列耗时约75秒,拉丁美洲区域约7000条耗时约40秒。按实例定价推算,每周推理费用约0.03美元。整套架构只在每6个月的微调阶段使用一次GPU(g5.4xlarge),其余全部CPU运行。

当AI行业在追逐千亿参数模型和万卡集群时,迪卡侬用事实给出了一个相反的信号:在零售预测这个场景里,120M参数的轻量级基础模型,以一种无人预料到的方式碾压了传统方案。

一场蓄谋已久的模型对决

迪卡侬的预测系统,历史上走过几代演进。从基于广义可加模型(GAM)和指数平滑法(Holt-Winters)的快速基线,到引入LightGBM等机器学习模型,再到最终采用DeepAR——一种基于自回归循环神经网络的深度学习方案。系统每周重训一次,运行在包括欧洲、印度、中国、东南亚和拉丁美洲在内的多个供应链区,每个区域覆盖多达25000种产品。

但这套路线的隐性成本很高。数据科学团队需要在每个区域配置不同的管道,每引入一个新市场,三类工程师需要约6个月才能完成部署。当公司计划继续向中东和非洲扩张时,这种模式变得不可持续。

转折点出现在2024到2025年间——时间序列基础模型(TSFM)走向成熟。Chronos、TimesFM、Moirai、Lag-Llama——这些名字开始密集出现在各种行业榜单上。但迪卡侬的团队做了一个关键决定:不看公开基准,直接拿自己的数据打擂台。

他们在欧洲供应链区,用超过39000种产品、跨越250万个时间序列的真实零售数据,对多个TSFM进行了头对头测试。候选模型包括Chronos-2、TimesFM 2-500M、TimesFM 2.5、Chronos Bolt、TimeGPT-1.5、Moirai 2等,与迪卡侬生产环境中的DeepAR(每周重训)和Holt-Winters统计基线做全面对比。

结果出乎团队意料。在零样本(zero-shot)条件下,TimesFM 2-500M是表现最好的TSFM——这一点与公开基准一致。但更关键的是,所有TSFM中的佼佼者已经能够接近甚至超越每周重训的DeepAR生产基线。这意味着一个未经任何微调的通用预训练模型,在垂直场景中已经能和每周针对性迭代的定制模型正面竞争。

而经过LoRA微调之后,Chronos-2在所有候选模型中全面领先:12周和52周两个预测窗口上均稳居第一。迪卡侬团队在Medium上公开发布的评价是:Chronos-2微调版是无争议的冠军(the undisputed champion)。

不过,数据背后也有细微差异。Chronos-2微调版虽然整体第一,但TimesFM 2-500M仍在43.2%的产品上略胜一筹。这说明不存在一个模型通吃所有SKU。而Chronos-2胜出的关键差异点之一,是它的群体注意力机制(group attention mechanism)天然支持外部协变量——比如价格变动、促销计划这些零售预测中必须考虑的因素。大多数TSFM处理协变量需要变通方法,Chronos-2则在架构层面直接解决了这个问题。

CPU上的轻量化革命

迪卡侬的架构选择有一个核心特征:对GPU的零依赖。

Chronos-2是一个120M参数的Transformer编码器模型,灵感来自T5架构。它将时间序列值通过缩放和量化分词化,把预测问题转化为语言建模任务。相比于那些动辄数百亿参数的大模型,Chronos-2的设计哲学是够用就好——它不仅在多个公开基准中排名前列(fev-bench、GIFT-Eval),更有能力在CPU上高效运行。

这个平衡点在整个架构中表现得很清楚。PySpark负责数据预处理,AutoGluon每6个月用LoRA对模型做一次高效微调,MLflow负责模型注册和版本管理。每周一次的推理任务通过AWS Batch调度,使用CPU实例m6i.8xlarge,按需启动、跑完即停。没有GPU集群待机浪费,只有每周一轮的短暂爆发。

这种设计带来的不仅是一个漂亮的成本数字,更是工程复杂度的急剧下降。微调频率从每周降为每6个月一次,推理运行时从10–15分钟(含重训)降为40–75秒,新区域部署时间从6个月(三人团队)缩短到2–3个月(仅需一名数据科学家、一名ML工程师和一名数据分析师)。

简而言之,TSFM把零售预测从每周重训一次定制模型的繁重运维,变成了每半年微调一次通用模型的轻量级工程。但这背后需要一套成熟的云基础设施来做支撑。AutoGluon的自动微调管道、AWS Batch的低成本批量调度、MLflow的模型版本管理——三个组件缺一不可,才让120M参数模型、CPU推理、每周3美分这个看似冒险的方案变得可靠。

从做模型到用模型

迪卡侬的故事揭示的是AI在垂直行业落地的通用范式转变。

旧范式的逻辑是:每个企业都自己做模型。组建数据科学团队、收集标注数据、从零训练定制模型、每周重训维护——这是一条昂贵且不可规模化的路径。迪卡侬过去六七年的预测系统演进,就是这条路径的标准写照。

新范式的逻辑是:预训练好的基础模型成为铲子——企业不再需要自己挖矿,只需要拿着铲子到自己的数据上铲一下,微调、推理,就可以直接用了。

这个转变的意义在于,它将AI能力从专家工程变成了配置工作。迪卡侬的团队不必再消耗大量工程资源在每周重训上,可以腾出手来处理更具商业价值的事情——比如将预测结果与采购系统对接、优化库存周转率、加速向中东和非洲扩展。

更深一层看,TSFM的成熟正在改变云厂商的竞争方式。Amazon将Chronos-2深度整合进AutoGluon、SageMaker JumpStart、AWS Batch等组件,使其成为一个即插即用的基础设施单元。Google将TimesFM整合到Vertex AI,Salesforce将Moirai整合到Einstein平台。基础模型正在成为云厂商锁定企业客户的新抓手——卖的不只是模型,是整个预测基础设施。

对于零售业的同行来说,迪卡侬的实践给出了一个可复用的行动路线:用公开基准做初筛、用自身数据跑头对头测试、选对模型后用LoRA做低成本微调、用云批量调度压降推理成本。

但也要警惕它的局限性。迪卡侬的测试显示,在部分精度指标上(如MASE和MIC),传统GAM+LightGBM组合仍有优势。TSFM不是银弹,而是在特定场景中性价比最优的选择。另外,迪卡侬目前只将TSFM用于需求预测的一个环节——每周销售数量预测——尚未涉及更复杂的多层级预测(门店级×SKU级×时间级),这仍是零售预测中公认最难攻克的阵地。

迪卡侬的Chronos-2部署目前已在东南亚和拉丁美洲供应链区投产,2026年的目标是覆盖所有供应区,中东和非洲是下一站。

一个容易被忽略的细节是:这场实践的开端并不在AWS官方博客里,而在迪卡侬数据团队自己发起的一场公共基准测试。他们在Medium上发布了详细的技术分析,公开了模型对比代码和结果。这种开放姿态在大型零售商中并不多见——它暗示着迪卡侬试图将自己在TSFM应用上的探索转化为行业影响力,甚至可能推动供应链技术人才的招聘和合作伙伴生态的构建。

从一双跑鞋到一个120M参数的Transformer模型,中间隔着的可能是整个行业对AI落地方式的重新理解。迪卡侬用每周3美分的成本证明了一个正在变成商业基本假设的判断:当基础模型足够好时,从零训练不再值得。这不是一个技术决策,这是一条正在改写的竞争规则。

作品声明:内容由AI生成