探所 Curio 再探再报 了解探所 →
#商业

Meta 新论文:字节级蒸馏上限更高

Meta FAIR 与华盛顿大学的一篇论文给蒸馏换了个基本单位:不再让学生学教师在十几万 Token 词表上的概率分布,而是把教师分布拆解到 256 种取值的字节空间,直接做**字节级蒸馏**。论文标题把话说得很直白 ——「突破 Token 天花板」。

💡 为什么值得看字节蒸馏比 Token 蒸馏下游上限高 4 个百分点。

实验里的三组关键数字

  • **预测上限**:Token 蒸馏 48.4%,Marginalize-It 50.5%,End-Of-Token 52.4%。
  • **数据与存储**:End-Of-Token 处理的实际文本量约为 Token 方案六分之一;Token 只存 top-600、字节存完整分布时,存储约五分之一。
  • **尚未验证**:普通字节监督模型渐近准确率预测 51.2%,高于 Marginalize-It 蒸馏的 50.5%;推理成本未做等成本比较。

查证

来源档案

量子位

中文 AI 科技媒体,本文为对 Meta FAIR 与华盛顿大学一篇论文的解读报道,附 arXiv 链接。

属二次解读:模型、参数量、缩放定律预测数字转述自论文,未独立复核;文中引用的 arXiv 编号未经核实,本探报不引用该编号。所有数字均为论文的渐近预测值,非已训完模型的实测成绩。

延伸阅读

为什幺字节空间更小反而上限更高 · qbitai.com
候选空间从 12 万压到 256,完整分布才存得下,top-k 截断丢掉的概率信息正是能力天花板的来源。
省数据不等于省算力 · qbitai.com
数据量降到六分之一,但训练 FLOPs 反而多出三成,等推理成本的公平比较论文还没做,这是决定能否落地的一环。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中