#AI
COLM 三篇论文质疑 Transformer 标配设计
COLM 2026 上,三篇论文同时把矛头对准了 Transformer 里那些「没人再质疑」的默认设计。它们各自独立验证的是同一件事:这些标配在长上下文、训练梯度和推理链等现有评测体系看不到的维度上,付出了实打实的代价。
康奈尔大学的《Lost in Backpropagation》给了个很直观的数字:输出投影层在反向传播时会削掉 **95% 到 99%** 的梯度范数,剩下的信号方向也和原来对不上。Ai2 团队的《Cracks in the Foundation》则用 26 个统一训练的 7B-8B 模型发现,GQA 和滑动窗口注意力一旦叠加,长上下文分数平均掉 9 分,比各自影响加起来还狠。
💡 为什么值得看同一场会议、三篇独立论文同时验证了主流模型默认架构的隐藏代价,对做长上下文、剪枝和训练的人都直接相关。
查证
来源档案
36 氪转载量子位
中文科技媒体对 COLM 2026 三篇论文的二手综述,原始素材来自量子位公众号,经 36 氪授权发布
内容为论文结果的转述,可信度受限于媒体二手转写;文中给出的分数、百分比等具体数字应与原论文(arxiv 或 COLM 官方)核对后再引用于强结论
延伸阅读
GQA、QK 归一化、滑动窗口各自无害但叠加有害,且影响随模型底子而反转,值得看逐个消融数据
95%-99% 梯度范数在输出投影层被削掉,关系到所有 LM 的训练效率上限,是最反常识的一条