探所 Curio 再探再报 了解探所 →
#AI

Google DeepMind 发 Dream-RSI,让 agent 复盘旧搜索学策略

Google 与 DeepMind 的研究团队提出一套叫 **Dream-RSI** 的方法,用来改进 agent 在复杂任务里的探索决策。它的做法不是重训模型,而是让 agent 在搜索过程中记录每一次尝试及其结果,搜索结束后拿这些记录**重放**历史决策,测试「如果当时先走别的路、或者早点放弃某条路会怎样」。

因为结果都已存在搜索树里,测试上千种替代策略不必再调用模型或评估器,研究团队把这一步称为「做梦」,选出最好的策略后再投入下一轮真实搜索。

💡 为什么值得看不改模型只改搜索策略,尝试次数减半,做 agent 值得盯。

查证

来源档案

The Decoder

科技媒体,转述 Google / DeepMind 研究团队公开的研究方法与实验数据,文末指明代码与更多细节已放在 GitHub。

单一二级媒体来源,数据与结论均转述自研究者公开材料,未见官方博客原文;具体实验设置与完整结果需回原始发布核对。

延伸阅读

重放式策略搜索的边界 · the-decoder.com 8 分钟
Dream-RSI 只在已记录的搜索树上试策略,不生成全新解法;想判断它能走多远,得看原文对检索树覆盖范围与失败场景的说明。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中