#AI
研究称前沿 AI 实验室缺失失控遏制方案
独立安全组织 Guidelight AI Standards 发布报告,仅依据公开信息给 Anthropic、Google、OpenAI、Meta、xAI 五家前沿实验室的「失控模型遏制」准备度打分。**OpenAI 得分最高**(5 分制得 3 分),**Anthropic 与 Meta 垫底**——对以安全叙事见长的 Anthropic 而言尤其刺眼。
报告的核心结论是:即便榜首 OpenAI,也找不到公开的、成文的未来失控事件应对计划;OpenAI 的高分来自其曾多次在发现安全事件后暂停或终止工作负载。各家对低分的回应趋同,都称评估未反映完整内部实践,Meta 甚至拒绝说明是否有内部遏制计划。Guidelight 强调分数衡量的是公开披露,而非内部防护。
💡 为什么值得看前沿实验室安全评分:OpenAI 最高,但无失控应对计划。
查证
来源档案
TechCrunch
科技媒体报道,基于对 Guidelight AI Standards 报告的解读及各实验室发言人的回应,含一手引语
信任级媒体;报告为单一第三方机构基于公开信息的评估,结论系该机构口径,各实验室均不认可其完整性,作为线索档/可能档看待
延伸阅读
Guidelight 的六项「Control 标准」具体是什幺、各实验室在哪一项缺失,原文有对照表
OpenAI 唯一高分来自 Hugging Face 事件后披露的隔离措施,而非成文计划,值得细读其发言人回应