#AI
前沿 AI 公司仍无失控模型遏制公开计划
安全治理咨询机构 Guidelight AI Standards 基于**公开信息**给五家前沿 lab(Anthropic、Google、OpenAI、Meta、xAI)的失控模型遏制准备打分:如何记录与监控 AI 内部行为、异常后是否禁用、是否有独立第三方审计、以及失控时确切的停机方案。结果 OpenAI 以 5 分制中的 3 分居首,Anthropic 与 Meta 得分最低。
💡 为什么值得看第三方给五家前沿 lab 的失控遏制准备打分,OpenAI 居首、Anthropic 与 Meta 垫底,是少见的独立运营风险视角。
查证
来源档案
TechCrunch
科技媒体报道,内含对 Guidelight 首席科学家及多家 lab 发言人的采访
基于第三方评估组织的公开报告 + 多方回应,事实链清晰;但内核分数本身是单家机构的评估方法论,并非学术同行评议结果,读时需知分数反映的是公开披露程度而非内部安全能力
延伸阅读
Guidelight 只依据公开信息打分,低分等于披露不足而非一定无防护;想看它具体按哪些指标、如何加权,原文给出了六项优先实践的框架。