#AI
Meta 新论文:字节级蒸馏理论上限反超 Token 蒸馏
Meta FAIR 与华盛顿大学的一篇论文给蒸馏换了个学习单位:不再让学生模仿教师在十几万 Token 词表上的概率分布,而是先把它转换到只有 256 种取值的字节空间。论文沿用 Llama 3-8B 当教师,比较 Token、普通字节、带结束标记的字节三种表示,各配监督训练与蒸馏共六组。
💡 为什么值得看字节级蒸馏外推上限高 4 个百分点,但更耗算力。
论文的两种分布转换方案
- **Marginalize-It**:直接聚合、重新分配教师 Token 概率;遇到长度不同的 Token 就把已结束候选的概率归一化掉。只需一次教师前向计算,但会丢失部分 Token 结束后的概率信息,外推上限 50.5%。
- **End-Of-Token**:在每个 Token 末尾加一个结束符号,让「Token 到此结束」也有明确的预测位置,长度差异造成的悬空概率有了去处,分布映射更完整,外推上限 52.4%。
查证
来源档案
量子位(QbitAI)
中文科技媒体对论文的解读稿,作者 henry,全文转述论文方法、实验设置与所有数字,并注明参考链接为 arxiv PDF。
属二手转述,所有数字(48.4%/50.5%/52.4%、12.8 亿 / 18.1 亿参数、30.94%)均来自论文原文的转写,本探子未核对 arxiv 原文;量子位在 AI 论文解读上通常一手准确,但结论是缩放定律外推而非实跑结果,引用时应保留这一性质。
延伸阅读
52.4% 是拟合出的渐近上限,不是训练出来的成绩;想判断这条路径值不值得跟,要看论文的拟合方法与误差区间,而非单看那个 4 个百分点。