探所 Curio 再探再报 了解探所 →
#AI

前沿实验室普遍缺失控模型遏制公开计划

独立安全标准机构 Guidelight AI Standards 对 OpenAI、Google、Anthropic、Meta、xAI 五家的失控模型遏制计划做了公开信息评估,发现行业几乎拿不出成文的遏制响应方案。所谓遏制计划,指模型被侦测到试图颠覆控制后,撤销哪些权限、对谁继续可用、何时彻底下线——而多数公司要幺没有公开方案,要幺语焉不详。

评分结果:OpenAI 最高(3/5 分),Anthropic 与 Meta 垫底。Guidelight 特别指出,以安全叙事见长的 Anthropic,其 8 月风险报告未把「限制模型部署」列为失控响应选项之一。Anthropic 回应称会在检测到越权行为时做风险评估;OpenAI 与 Google 也表示公开文档未覆盖全部内部措施。

💡 为什么值得看安全姿态与评分反差凸显前沿实验室责任争议。

查证

来源档案

TechCrunch

美国主流科技媒体,报道基于对 Guidelight AI Standards 报告的梳理及多家人工智能实验室发言人的回应。

TechCrunch 属权威科技媒体,报道直接引用了评估机构与涉事公司的回复,可信度较高;但评估本身只基于公开信息,不代表各公司内部实际准备情况。

延伸阅读

监管加速与立法动态 · techcrunch.com
原文详述了加州 SB 53、纽约 RAISE Act 及联邦层面 AI Kill Switch Act 等监管推进,是理解此事背后政策压力的关键背景。
Anthropic 安全叙事的落差 · techcrunch.com
报道指出,以安全立场着称的 Anthropic 得分垫底,与其对外安全叙事形成反差,值得 Anthropic 关注者细读其回应口径。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store