#AI
Google 用离线 RL 把搜索扇出压进单次前向
Google Research 发文介绍 Retrieve-for-Train:一个把「想清楚该拆成哪些子查询」从推理时挪到离线训练里的检索框架。
做法是先用离线 RL 找出奖励对齐的扇出结果,编译成监督信号,再把这套行为蒸馏进一个 **53.9M 参数的扩散检索器**——推理时一次非自回归前向就吐出整组目标 embedding,不再逐 token 生成思维链。
💡 为什么值得看推理思考挪进离线训练,扇出延迟最高降 20 倍,更值得看其用奖励约束防退化。
查证
来源档案
Google Research Blog
Google Research 官方研究博客,介绍其 ICML 2026 论文的工作
一手官方发布,框架与数字均为 Google 自述;但延迟与质量结论来自其自有评测,无独立复现,应视为官方口径而非第三方验证。
延伸阅读
文中专门讲了 groundedness 单独用会被 reward hacking、加对齐又会塌成复读,多样性项是解题关键 —— 做 agent 奖励设计的可以直接看这一段的取舍逻辑。
结论段提出 RL 更适合做一次性的 objective transducer 而非在线推理引擎,这个定位对任何想往产品里塞 test-time compute 的团队都有参考价值。