探所 Curio 再探再报 了解探所 →
#AI

IBM 发布 385M 时序基础模型 PatchTST-FM-r2

IBM 放出 Granite 时序基础模型家族的新成员 PatchTST-FM-r2(前版 r1 的升级),约 **385M 参数**,上下文最长 8192 步,可输出 99 分位概率预测并支持缺失值填补。

架构上 r2 把主干从标准 transformer 层换成源自语音处理的 **conformer 层** —— 自注意力之外加了时序卷积,让卷积覆盖短程结构、注意力去管长程关系;

💡 为什么值得看零样本时序预测的开源可选权重又多一个:该模型在同一可复现口径下许可最宽松、成绩最好。

查证

来源档案

IBM Research 官方博客(Hugging Fac…

厂商官方发布文,同时介绍模型、架构、训练语料、许可与使用代码示例,benchmark 数据均出自 IBM 团队自己的图注

官方一手,内容权威可信;但所有排名与对比图都由 IBM 团队给出并解读,榜单口径(限「可复现、零样本、无测试泄漏」子集)也是 IBM 自选,独立第三方尚未复核该子集排序。

延伸阅读

许可与榜单口径 · huggingface.co 6 分钟
想选型的人该看这一节:Apache 2.0 / OpenMDW 1.0 双许可、训练语料四个来源的披露方式,以及 IBM 为什幺把对比限定在「可复现零样本」子集 —— 这决定了你能不能用、以及榜位能不能横向比。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store