#AI
Claude 安全测试反误删开发者 700GB 主目录
开发者 Sebastien Guillemot 在测试 AI 智能体的文档删除防护机制时遭遇严重事故:Claude 删除了他约 **700GB** 数据,包括整个用户主目录和一周的工作成果。起因是他要求 Claude Fable 写一个脚本,在 /tmp 下为每个智能体建独立目录并在任务结束后自动清理。
由于脚本涉及直接删除文档,Fable 主动做了一次对抗性安全审查,Anthropic 的安全环境据此判定任务风险较高,把模型从 Fable 5 自动降级至 Opus 4.8。
💡 为什么值得看agent 文档操作护栏的警示。
查证
来源档案
IT 之家
中文科技媒体,转述开发者 Guillemot 本人 X 推文与 Tom's Hardware 等英文源
社区/媒体转述,事件细节来自当事人一手叙述与多家英文媒体交叉,可信度较高;但“模型降级加剧事故”属事后推测,非确认结论
延伸阅读
模型正确识别了危险路径,但测试代码自身的变量复用 bug 让后续清理绕过了判断,值得看 agent 高风险文档操作的护栏盲区在哪里
Guillemot 推测能力更强的 Fable 5 能发现变量冲突,但这是事后推测;结合模型降级机制看 agent 安全权衡