探所 Curio 再探再报 了解探所 →
#AI

4-bit 模型反超 16-bit 原版

Multiverse Computing 发布论文,提出 **Quantization-Aware Healing(QAH)**:针对已经做过结构压缩、再量化的模型,直接以压缩前的全尺寸、全精度原始模型为教师做 KL 蒸馏,而不是从恢复后的 bf16 检查点蒸馏。作者认为后者自身就是有损的,会封顶量化学生的精度上限。

该方法在 GPT-OSS 120B 压到 60B、量化到 MXFP4 后,在 9 个基准里 7 个超过自己的 bfloat16 版,长上下文推理 AA-LCR +7.4、AIME 2025 数学 +5.6,还在 LiveCodeBench 上反超全尺寸 120B 教师。效率侧,4-bit 权重内存约降到 bf16 的四分之一。想要完整 pipeline 细节需读原论文。

💡 为什么值得看4-bit 量化反超全精度,训练快数倍。

查证

来源档案

Multiverse Computing 官方 HF 博客

厂商官方技术博客,宣布自家研究论文(Quantization-Aware Healing)的主要方法与基准结果

官方一手源,数值声称可信;但基准结果为自报,未经独立复现,超越全精度原版的结论应视为作者方声称

延伸阅读

方法原理对比 · huggingface.co
博客详细解释了 QAH 与 QAT、QAD 的差异,以及借助 chunked KL 支持 32k 长上下文的机制,适合想理解为什幺能反超的读者。
训练稳定性曲线 · huggingface.co
QAH 与 QAT 的收敛对照(100 步对 700 步、QAT 后期崩 19 分)是部署风险层面的关键论据,做模型上线的人值得细看。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store