探所 Curio 再探再报 了解探所 →
#AI

Anthropic 首个嵌入式评估方落地 Accenture

Dario Amodei 要把第三方安全评估方请进 AI 实验室的设想,落到了第一个具体对象上。Anthropic 宣布与 Accenture 合作,由后者今年 1 月收购来的 AI 部门 **Faculty** 进驻 Anthropic 内部,对模型和员工工作进行审视。评估范围包括**红队测试模型、开展对齐评估、检验模型安全防护**。

双方各自预计在未来五年投入**至少 $1 billion** 建设这项能力,且 Anthropic 会**直接出资**支持 Accenture 的工作。相比今天的外部评估,嵌入式评估者将拿到接近员工级别的权限:能观察训练中的模型成形过程、跟进模型构建与部署的决策、直接与员工对话,据此核实公司是否守住了安全承诺。

💡 为什么值得看咨询巨头各投 10 亿,评估独立性能否成立。

这桩合作还没定下来的部分

  • **无行业标准**:Anthropic 自己承认,嵌入式评估者该获得哪些信息的访问权、发现问题后如何上报,目前都不存在标准。
  • **钱从哪来**:长期看 Anthropic 主张评估资金应由共同池或政府提供,但这两者今天都不存在,所以现阶段只能按不同评估方、不同出资安排分别处理。
  • **质疑声音**:有批评者认为,让行业自我监督的方案本质是规避问责。Anthropic 回应称评估者不减少其责任,只是让责任更可核查,模型安全仍由自己负责。
  • **市场反应**:Accenture 股价盘后上涨 8%。此前围绕嵌入式评估的讨论多集中在 METR、Redwood Research、Apollo Research 这类安全研究机构身上。

查证

来源与可信度

· Anthropic 宣布与 Accenture 合作,由旗下 AI 部门 Faculty 进驻 Anthropic 内部做嵌入式评估。 [1][2]
· 双方各预计在未来五年投入至少 $1 billion 建设这项能力,Anthropic 直接出资支持 Accenture 的工作。 [1][2]
孤证 · 嵌入式评估者可获得接近员工级别的访问权限,包括观察训练中的模型、查看部署决策、直接与员工交流。 [1]
· Anthropic 称该合作非排他,数周内公布更多评估方,并正与 METR 等非营利机构洽谈用其自有资金试点。 [1][2]

延伸阅读

逐条读官方公告里「还没有标准」和「出资安排」两段 · anthropic.com
这是判断嵌入式评估能否真独立的关键,细节都在这两段里,摘要会丢掉
TechCrunch 对 · techcrunch.com
同一事件的第二来源,补上了股价和外界质疑这一层,官方公告不会提
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中