探所 Curio 再探再报 了解探所 →
#AI

阿里两篇顶会论文拆解循环 Transformer

GPT-6 Astra 发布后,其采用的「循环深度」(recurrent depth)技术 —— 让同一组 Transformer 层反复运行、用计算深度换参数规模 —— 一夜成为热点。阿里及合作高校团队早在 11 个月前就切入这条路线,把循环架构最现实的「计算冗余」问题拆开了。

两篇论文各管一头:**MeSH**(ICLR 2026)用 Memory Buffer 加读写路由器解决循环之间「以什幺信息交接」,在 Pythia-1.4B 上减少约 33% 非嵌入参数的同时,零样本平均准确率反超普通 Transformer;**SpiralFormer**(EMNLP 2026)让每轮循环在更短的串行分辨率上计算,从全局到局部逐步聚焦,同等算力下成绩更高。

💡 为什么值得看循环深度技术省参数换深度成热点,阿里论文拆解其计算冗余卡点。

查证

来源档案

量子位

中文 AI 科技媒体,本文是带作者解读的技术综述,介绍阿里两篇论文并夹带 GPT-6 Astra、Claude Mythos 背景铺垫

论文标题、接收会议、实验数据均给出具体可核对的数字与 arxiv 链接,可信度中等偏上;但「GPT-6 采用循环深度」等背景信息标注为 The Information 爆料,非官方确认,读时需区分论文事实与外围推测

延伸阅读

MeSH 结构详解 · qbitai.com 8 分钟
原文用三张「摸鱼证据」图解释循环为何空转,以及 Memory Buffer 双路由器如何缓解,适合想理解循环架构内部机制的人
SpiralFormer 多分辨率 · qbitai.com 6 分钟
从 1/8 长度逐步放大到完整串行的设定,以及 attention probing 证明模型确实从全局转向局部,是理解第二代架构方向的关键
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store