#AI
阿里两篇论文拆解循环 Transformer 冗余
GPT-6 Astra 发布后,循环 Transformer(recurrent depth)一下成了热门话题:让同一组层反复运行,用计算深度换参数规模。
但学界早有踩坑经验——同等算力下,省参数的循环模型经常打不过普通 Transformer,卡点在于「计算冗余」:循环圈数增加了,后续几轮对 hidden state 带来的增量却越来越小。
💡 为什么值得看循环 Transformer 过热,阿里早发两篇论文解冗余。
查证
来源档案
量子位
中文科技媒体,对两篇阿里相关论文的技术综述
综述性报道,论文结论与顶会接收状态转述自论文本身,数字完整;但单源、无第二独立媒体互证,顶会接收状态与评测数据以原文为准
延伸阅读
文中给了三个「摸鱼证据」:后续 loop 状态变化缩小、相邻轮次表示高度相似、表示挤进低维空间,是理解计算冗余成因的关键
循环发生在 hidden state、中间过程未必可读成思维链,OpenAI 被安全专家讨伐、首席科学家 Jakub Pachocki 亲自下场回应,是架构选择与可解释性张力的一手脉络