#AI
Google DeepMind 发 Dream-RSI,让 agent 复盘旧搜索学策略
Google 与 DeepMind 的研究团队提出一套叫 **Dream-RSI** 的方法,用来改进 agent 在复杂任务里的探索决策。它的做法不是重训模型,而是让 agent 在搜索过程中记录每一次尝试及其结果,搜索结束后拿这些记录**重放**历史决策,测试「如果当时先走别的路、或者早点放弃某条路会怎样」。
因为结果都已存在搜索树里,测试上千种替代策略不必再调用模型或评估器,研究团队把这一步称为「做梦」,选出最好的策略后再投入下一轮真实搜索。
💡 为什么值得看不改模型只改搜索策略,尝试次数减半,做 agent 值得盯。
查证
来源档案
The Decoder
科技媒体,转述 Google / DeepMind 研究团队公开的研究方法与实验数据,文末指明代码与更多细节已放在 GitHub。
单一二级媒体来源,数据与结论均转述自研究者公开材料,未见官方博客原文;具体实验设置与完整结果需回原始发布核对。
延伸阅读
Dream-RSI 只在已记录的搜索树上试策略,不生成全新解法;想判断它能走多远,得看原文对检索树覆盖范围与失败场景的说明。