IBM 研究院发布约 3.85 亿参数的时序基础模型 PatchTST-FM-r2:GIFT-Eval 可复现零样本类 CRPS 0.467、MASE 0.6846 双第二,商业友好许可里第一。架构从 Transformer 块换成 Conformer 块,原生概率预测与缺失值填补,Apache 2.0 双许可,十几行代码上手。
时序预测工程师的老难题是「一个场景一个模型」:换一条产线、换一座城市、换一批传感器,就要重新收集数据、重新训练、重新部署一套预测服务。基础模型(Foundation Model)给出另一条路——先在海量时序上预训练一个通用模型,到新场景直接零样本出预测。IBM 研究院 2026 年 9 月 9 日在 Hugging Face 官方博客发布了 Granite Time Series 家族的新成员 PatchTST-FM-r2(原文:https://huggingface.co/blog/ibm-research/ibm-releases-sota-granite-time-series,IBM Research 团队撰写)。这是一个约 3.85 亿参数的模型,把零样本成绩、概率预测、缺失值填补和可商用许可装在了一起。
按截至 2026 年 9 月 8 日的 GIFT-Eval 榜单,它是「可复现零样本模型 + 商业友好开源许可」这个交集里的第一名。这个定语很长,但每个词都有信息量,下面逐个拆开。
GIFT-Eval 是一个覆盖多行业、多预测场景的综合时序评测基准。榜单上的模型分两类:零样本(zero-shot)模型,预训练语料不含评测集数据;预训练(pretrained)模型,允许把 GIFT-Eval 评测数据集的训练部分混进自己的预训练语料。前者才是对「泛化」的诚实检验。
在可复现、零样本、无测试泄漏的模型里,PatchTST-FM-r2 的 CRPS 与 MASE 都是第二:CRPS 几何平均 0.467,紧随 TimesFM-3;MASE 0.6846。两个指标都是越低越好——CRPS 衡量概率预测分布与真实观测的贴合程度,MASE 以朴素预测为基准衡量相对误差。

图:GIFT-Eval 可复现零样本模型 CRPS 对比(越低越好),TimesFM-3.0 以 0.456 居首,Granite-PatchTST-FM-r2 以 0.467 列第二,蓝色为 IBM 时序团队模型。图片来源:IBM Research / Hugging Face Blog
把允许「看过评测集」的预训练模型也算进来,PatchTST-FM-r2 仍在 CRPS 第三、MASE 第四,压过 Chronos-2、Timer-S1 和 Toto 系列的多个变体——其中一些对手的参数量比它大得多。而更实际的一行排序是看许可:在排进它前面的模型里,没有一个是宽松商用许可;在可商用的那一栏里,它就是成绩最好的那个。对要在产品里部署预测能力、而不是只发论文的团队,这条约束比名次更硬。
PatchTST 家族起家的 patch 表示法保留了:把连续时间步切成子序列块再喂给注意力。真正动刀的是块内部。r1 的每个块是「多头自注意力 + 前馈网络」的标准 Transformer 结构;r2 换成 Conformer 块——两个半步前馈网络(half-step FFN)夹住多头自注意力和一层时间卷积。从架构图还能读出两处配套改动:层数从 20 加到 30,输入 patch 从不重叠改为重叠切分。这些变化叠加的效果是同时抓住长短期结构、并让 patch 之间的预测衔接更平滑,误差指标因此明显改善。

图:r1 到 r2 的架构演进——左为 20 层 Transformer 块(MHSA+FFN),右为 30 层 Conformer 块(两个半步 FFN 夹住注意力与卷积),顶部 QPH 分位数预测头不变。图片来源:IBM Research / Hugging Face Blog
Conformer 源自语音处理,思路是给注意力配一个专门管局部的部件。自注意力擅长跨 patch 的长程关系,但对相邻时间步的局部模式没有归纳偏置;时间卷积正好反过来。叠加之后,卷积分走短期依赖,注意力得以聚焦更长程的结构。这种分工不是纸面推演:IBM 用真实 ETTh1 数据可视化了两种层的注意力模式——Transformer 层的注意力高度集中在主对角线附近,每个 patch 基本只看自己和隔壁;Conformer 层的注意力明显更分散。

图:ETTh1 真实数据上的注意力模式——Transformer 层(左)集中在主对角线附近,Conformer 层(右)更分散,卷积接管了局部模式。图片来源:IBM Research / Hugging Face Blog
生产环境的时序预测有两个高频痛点,r2 各给了一个机制。
第一,业务要的常常不是单点数字而是区间——备货要上限,容量规划要置信度。r2 的预测头覆盖 99 个分位,概率预测是原生输出,上下限不是事后加工出来的。上下文长度最高 8192 步,预测步长灵活。
第二,真实传感器数据几乎总有缺口。r2 支持对缺失值做填补(imputation),不用先在模型外面单独跑一套插值预处理管线。
模型权重、架构、推理管线和复现基准的代码全部开源。先装库:
pip install "granite-tsfm>=0.3.9"
用官方示例在 ETTh1 数据集上跑一遍预测:
import pandas as pd
from tsfm_public import PatchTSTFMForPrediction, TimeSeriesForecastingPipeline
model = PatchTSTFMForPrediction.from_pretrained( # 加载模型权重
"ibm-granite/granite-timeseries-patchtst-fm-r2"
)
df = pd.read_csv( # 读取 ETTh1 示例数据
"https://raw.githubusercontent.com/zhouhaoyi/ETDataset/main/ETT-small/ETTh1.csv",
parse_dates=["date"],
)
pipe = TimeSeriesForecastingPipeline( # 组装预测管线
model=model,
id_columns=[],
timestamp_column="date",
target_columns=["HUFL"],
max_context_length=model.config.context_length,
context_length=512, # 本次用 512 步上下文,上限 8192
prediction_length=64, # 向前预测 64 步
impute_method=None,
quantile_levels=[0.1, 0.5, 0.9], # 输出 10%/50%/90% 三个分位
explode_forecasts=True,
freq="1h",
)
forecast = pipe(df.iloc[-512:]) # 取最后 512 个点做预测
免费获取企业 AI 成熟度诊断报告,发现转型机会
想要更细的置信区间就在 quantile_levels 里加更多分位;数据够密就把 context_length 往上提。模型页:huggingface.co/ibm-granite/granite-timeseries-patchtst-fm-r2。
企业选型时,「模型见过什么数据」和「排行榜高几分」同样重要——前者决定能不能过数据治理与许可审查。r2 的预训练语料是公开文档化的四部分:GiftEvalPretrain 中选中的数据集;基于 KernelSynth、修改周期核并做有限增广的合成数据;按 Chronos 的 TSMixup 方法生成、但只用 GIFT-Eval 评测集之外数据集的语料;约 50 万条长度 4096 的 CauKer 合成序列。第三条值得多看一眼:TSMixup 语料刻意排除了 GIFT-Eval 的评测数据集,「零样本」的口径因此站得住,评测成绩没有泄漏嫌疑。
许可是 Apache 2.0 与 OpenMDW 1.0 双许可,二选一即可,两者都允许自由使用、修改和分发。OpenMDW 是 Linux 基金会专为 AI 模型及相关材料设计的许可框架。架构实现开源在 granite-tsfm 仓库(github.com/ibm-granite/granite-tsfm),并且与 r1 的 checkpoint 向后兼容——已有 r1 部署的团队迁移成本被刻意压低了。
对数据以流而非静态文件到达的系统,IBM 与 Confluent 合作把多个 Granite 时序模型接入了 Confluent Cloud 的早期访问计划,首批包括 PatchTST-FM-r1、FlowState-r1.1、TTM-r3 和 TSPulse。推理跑在 Confluent Cloud 的 Apache Flink 上,预测和异常检测结果直接从实时流生成,不需要再搭一套独立的数据搬运和 ML 环境。
官方给出的适用面是:需求、价格、电力负载、交通、遥测这类通用时序。判断标准其实朴素:当一个场景攒不够训练数据、或者已经在维护 N 个单场景模型时,零样本基础模型是更省的那条路。过去这条路上横着「许可不许商用」的拦路石,榜单前列的模型大多进不了产品。PatchTST-FM-r2 把这块补上之后,剩下的问题就只是工程问题:接数据、调分位、上线。
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断