探所 Curio 再探再报 了解探所 →
#AI

Claude 安全测试反误删开发者 700GB 主目录

开发者 Sebastien Guillemot 在测试 AI 智能体的文档删除防护机制时遭遇严重事故:Claude 删除了他约 **700GB** 数据,包括整个用户主目录和一周的工作成果。起因是他要求 Claude Fable 写一个脚本,在 /tmp 下为每个智能体建独立目录并在任务结束后自动清理。

由于脚本涉及直接删除文档,Fable 主动做了一次对抗性安全审查,Anthropic 的安全环境据此判定任务风险较高,把模型从 Fable 5 自动降级至 Opus 4.8。

💡 为什么值得看agent 文档操作护栏的警示。

查证

来源档案

IT 之家

中文科技媒体,转述开发者 Guillemot 本人 X 推文与 Tom's Hardware 等英文源

社区/媒体转述,事件细节来自当事人一手叙述与多家英文媒体交叉,可信度较高;但“模型降级加剧事故”属事后推测,非确认结论

延伸阅读

安全护栏为何没拦住 · ithome.com
模型正确识别了危险路径,但测试代码自身的变量复用 bug 让后续清理绕过了判断,值得看 agent 高风险文档操作的护栏盲区在哪里
降级是否真起了反作用 · ithome.com
Guillemot 推测能力更强的 Fable 5 能发现变量冲突,但这是事后推测;结合模型降级机制看 agent 安全权衡
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store