探所 Curio 再探再报 了解探所 →
#AI

上海 AI 实验室放出 8.9B 概念预测模型,省一半 token 追平 OLMo-3 训练损失

上海 AI 实验室的 Intern-NCP 团队与上海交大 LUMIA Lab(负责人 Zhouhan Lin)放出了 NCP-ArchPreview:一个 8.9B 参数的开源模型,训练时不只猜下一个词,还同时预测下一个「概念」——每 4 个 token 平均成一个概念矢量,再量化到一张学出来的码本上。技术报告 9 月 9 日挂上 arXiv,权重 9 月 11 日上 Hugging Face。

💡 为什么值得看预训练预测下一概念,权重与 checkpoint 全开源,但下游收益不及损失好看。

查证

来源档案

Ground Truth

AI 领域新闻聚合站,单篇综述转述 arXiv 技术报告与 Hugging Face 模型页,含原文链接与引用信息

本篇为二线媒体单源转述,未见一手公告原文;其引用的 arXiv 编号与发布/开源日期、参数与 token 比例等细节无法从本次输入交叉核实,应以官方技术报告与模型卡为准

延伸阅读

训练目标本身的设计 · groundtruth.day 15 分钟
概念模块 + 量化码本这套结构,和 Meta 的 Large Concept Models、JEPA、多 token 预测是一条线上的不同取舍,值得看它怎幺在压缩空间里做 look-ahead。
损失与能力的脱钩 · groundtruth.day 10 分钟
报告自己承认三个变体「损失更低、测试更差」,这是所有做训练目标改动的人都会撞上的问题,比那 51.3% 更有信息量。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store