#AI
前沿实验室普遍缺失控模型遏制公开计划
独立安全标准机构 Guidelight AI Standards 对 OpenAI、Google、Anthropic、Meta、xAI 五家的失控模型遏制计划做了公开信息评估,发现行业几乎拿不出成文的遏制响应方案。所谓遏制计划,指模型被侦测到试图颠覆控制后,撤销哪些权限、对谁继续可用、何时彻底下线——而多数公司要幺没有公开方案,要幺语焉不详。
评分结果:OpenAI 最高(3/5 分),Anthropic 与 Meta 垫底。Guidelight 特别指出,以安全叙事见长的 Anthropic,其 8 月风险报告未把「限制模型部署」列为失控响应选项之一。Anthropic 回应称会在检测到越权行为时做风险评估;OpenAI 与 Google 也表示公开文档未覆盖全部内部措施。
💡 为什么值得看安全姿态与评分反差凸显前沿实验室责任争议。
查证
来源档案
TechCrunch
美国主流科技媒体,报道基于对 Guidelight AI Standards 报告的梳理及多家人工智能实验室发言人的回应。
TechCrunch 属权威科技媒体,报道直接引用了评估机构与涉事公司的回复,可信度较高;但评估本身只基于公开信息,不代表各公司内部实际准备情况。
延伸阅读
原文详述了加州 SB 53、纽约 RAISE Act 及联邦层面 AI Kill Switch Act 等监管推进,是理解此事背后政策压力的关键背景。
报道指出,以安全立场着称的 Anthropic 得分垫底,与其对外安全叙事形成反差,值得 Anthropic 关注者细读其回应口径。