#AI
IBM 发布 385M 时序基础模型 PatchTST-FM-r2
IBM 放出 Granite 时序基础模型家族的新成员 PatchTST-FM-r2(前版 r1 的升级),约 **385M 参数**,上下文最长 8192 步,可输出 99 分位概率预测并支持缺失值填补。
架构上 r2 把主干从标准 transformer 层换成源自语音处理的 **conformer 层** —— 自注意力之外加了时序卷积,让卷积覆盖短程结构、注意力去管长程关系;
💡 为什么值得看零样本时序预测的开源可选权重又多一个:该模型在同一可复现口径下许可最宽松、成绩最好。
查证
来源档案
IBM Research 官方博客(Hugging Fac…
厂商官方发布文,同时介绍模型、架构、训练语料、许可与使用代码示例,benchmark 数据均出自 IBM 团队自己的图注
官方一手,内容权威可信;但所有排名与对比图都由 IBM 团队给出并解读,榜单口径(限「可复现、零样本、无测试泄漏」子集)也是 IBM 自选,独立第三方尚未复核该子集排序。
延伸阅读
想选型的人该看这一节:Apache 2.0 / OpenMDW 1.0 双许可、训练语料四个来源的披露方式,以及 IBM 为什幺把对比限定在「可复现零样本」子集 —— 这决定了你能不能用、以及榜位能不能横向比。