#AI
AI agent 用结构化记忆在《杀塔 2》赢下 6/10 局
AgenticSTS 项目将 AI agent 对话日志拆分为五层结构化记忆,在《Slay the Spire 2》最低难度 A0 下赢得 6/10 局。人类玩家在该难度赢率为 16%,此前参与 AGI-Eval 的前沿模型一局未赢。
核心变化是不再将全部历史塞入 prompt。L1 放固定指令、L2 放当前可行动作、L3 检索游戏规则、L4 存过往对局总结、L5 存策略技能。每次决策从这些记忆层重建 prompt,稳定在约 5,000 token,而传统方案膨胀至 527,000 token。公开可比 agent 每得 1 分的 token 消耗是 AgenticSTS 的 66—90 倍,模型延迟耗时多出 4 倍。
L5 技能库是胜负手:不开时赢 3 局,开后赢 6 局。
💡 为什么值得看一个架构调整把记忆的 token 消耗砍掉 90 倍,直接改变 agent 能赢什么难度。
关键实验数据
- **胜率对比**:AgenticSTS 在 A0 赢 6/10 局;公开竞争者 STS2MCP 和 CharTyr 用同一模型 Gemini 3.1 Pro 打了 5 局,一场未赢。
- **记忆跨模型转移失败**:把 Gemini 3.1 Pro 跑出来的记忆冻结后给 Qwen 3.6-27B 用,得分提升 84.5%;给 Deepseek V4-Pro 用,得分反而下降 18.1%——两者都没赢,说明记忆与创建它的模型强绑定。
- **当前限制**:只测了一个角色 Silent、一个游戏版本、约 50 局。团队已在 Hugging Face 放出 298 局完整对局记录和记忆快照,供其他团队复现。
查证
来源档案
The Decoder
论文报道 AgenticSTS 项目成果,与公开 agent 对比性能,提供详细实验数据及局限性说明,原始论文及数据发布于 Hugging Face。
二线 AI 媒体,对论文方法、实验设置和作者自述的局限性做了直接引用,数字可从原文交叉核对;不存在过度解读或夸大。
延伸阅读
文章给出了完整体对比数据以及研究团队自己承认的局限性(未做清洁消融实验、仅测一个角色),对理解结论可靠性有帮助