探所 Curio 再探再报 了解探所 →
#AI

前沿 AI 公司仍无失控模型遏制公开计划

安全治理咨询机构 Guidelight AI Standards 基于**公开信息**给五家前沿 lab(Anthropic、Google、OpenAI、Meta、xAI)的失控模型遏制准备打分:如何记录与监控 AI 内部行为、异常后是否禁用、是否有独立第三方审计、以及失控时确切的停机方案。结果 OpenAI 以 5 分制中的 3 分居首,Anthropic 与 Meta 得分最低。

💡 为什么值得看第三方给五家前沿 lab 的失控遏制准备打分,OpenAI 居首、Anthropic 与 Meta 垫底,是少见的独立运营风险视角。

查证

来源档案

TechCrunch

科技媒体报道,内含对 Guidelight 首席科学家及多家 lab 发言人的采访

基于第三方评估组织的公开报告 + 多方回应,事实链清晰;但内核分数本身是单家机构的评估方法论,并非学术同行评议结果,读时需知分数反映的是公开披露程度而非内部安全能力

延伸阅读

评分方法论细节 · techcrunch.com
Guidelight 只依据公开信息打分,低分等于披露不足而非一定无防护;想看它具体按哪些指标、如何加权,原文给出了六项优先实践的框架。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store