#商业
Meta 新论文:字节级蒸馏上限更高
Meta FAIR 与华盛顿大学的一篇论文给蒸馏换了个基本单位:不再让学生学教师在十几万 Token 词表上的概率分布,而是把教师分布拆解到 256 种取值的字节空间,直接做**字节级蒸馏**。论文标题把话说得很直白 ——「突破 Token 天花板」。
💡 为什么值得看字节蒸馏比 Token 蒸馏下游上限高 4 个百分点。
实验里的三组关键数字
- **预测上限**:Token 蒸馏 48.4%,Marginalize-It 50.5%,End-Of-Token 52.4%。
- **数据与存储**:End-Of-Token 处理的实际文本量约为 Token 方案六分之一;Token 只存 top-600、字节存完整分布时,存储约五分之一。
- **尚未验证**:普通字节监督模型渐近准确率预测 51.2%,高于 Marginalize-It 蒸馏的 50.5%;推理成本未做等成本比较。
查证
来源档案
量子位
中文 AI 科技媒体,本文为对 Meta FAIR 与华盛顿大学一篇论文的解读报道,附 arXiv 链接。
属二次解读:模型、参数量、缩放定律预测数字转述自论文,未独立复核;文中引用的 arXiv 编号未经核实,本探报不引用该编号。所有数字均为论文的渐近预测值,非已训完模型的实测成绩。
延伸阅读
候选空间从 12 万压到 256,完整分布才存得下,top-k 截断丢掉的概率信息正是能力天花板的来源。
数据量降到六分之一,但训练 FLOPs 反而多出三成,等推理成本的公平比较论文还没做,这是决定能否落地的一环。