探所 Curio 再探再报 了解探所 →
#AI

Google 用离线 RL 把搜索扇出压进单次前向

Google Research 发文介绍 Retrieve-for-Train:一个把「想清楚该拆成哪些子查询」从推理时挪到离线训练里的检索框架。

做法是先用离线 RL 找出奖励对齐的扇出结果,编译成监督信号,再把这套行为蒸馏进一个 **53.9M 参数的扩散检索器**——推理时一次非自回归前向就吐出整组目标 embedding,不再逐 token 生成思维链。

💡 为什么值得看推理思考挪进离线训练,扇出延迟最高降 20 倍,更值得看其用奖励约束防退化。

查证

来源档案

Google Research Blog

Google Research 官方研究博客,介绍其 ICML 2026 论文的工作

一手官方发布,框架与数字均为 Google 自述;但延迟与质量结论来自其自有评测,无独立复现,应视为官方口径而非第三方验证。

延伸阅读

复合奖励怎幺防退化 · research.google 5 分钟
文中专门讲了 groundedness 单独用会被 reward hacking、加对齐又会塌成复读,多样性项是解题关键 —— 做 agent 奖励设计的可以直接看这一段的取舍逻辑。
把 RL 当离线编译器 · research.google 3 分钟
结论段提出 RL 更适合做一次性的 objective transducer 而非在线推理引擎,这个定位对任何想往产品里塞 test-time compute 的团队都有参考价值。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中