#AI
上海 AI 实验室放出 8.9B 概念预测模型,省一半 token 追平 OLMo-3 训练损失
上海 AI 实验室的 Intern-NCP 团队与上海交大 LUMIA Lab(负责人 Zhouhan Lin)放出了 NCP-ArchPreview:一个 8.9B 参数的开源模型,训练时不只猜下一个词,还同时预测下一个「概念」——每 4 个 token 平均成一个概念矢量,再量化到一张学出来的码本上。技术报告 9 月 9 日挂上 arXiv,权重 9 月 11 日上 Hugging Face。
💡 为什么值得看预训练预测下一概念,权重与 checkpoint 全开源,但下游收益不及损失好看。
查证
来源档案
Ground Truth
AI 领域新闻聚合站,单篇综述转述 arXiv 技术报告与 Hugging Face 模型页,含原文链接与引用信息
本篇为二线媒体单源转述,未见一手公告原文;其引用的 arXiv 编号与发布/开源日期、参数与 token 比例等细节无法从本次输入交叉核实,应以官方技术报告与模型卡为准
延伸阅读
概念模块 + 量化码本这套结构,和 Meta 的 Large Concept Models、JEPA、多 token 预测是一条线上的不同取舍,值得看它怎幺在压缩空间里做 look-ahead。
报告自己承认三个变体「损失更低、测试更差」,这是所有做训练目标改动的人都会撞上的问题,比那 51.3% 更有信息量。