探所 Curio 再探再报 了解探所 →
#AI

Anthropic 称 Claude 有部分内省能力

Anthropic 在官方研究博客发布内省(introspection)研究,称实验提供了「当前 Claude 模型具备一定程度内省意识」的证据,同时强调这一能力**高度不可靠、适用范围有限**,没有证据表明模型能像人类那样或达到人类程度地内省。

方法上,研究团队用「概念注入」(concept injection)把已知含义的神经活动模式塞进不相关的上下文,再问模型有没有察觉到。

💡 为什么值得看Opus 4.1 约 20% 能察觉被注入念头,多数失败。

查证

来源档案

Anthropic Research(introspect…

Anthropic 官方研究博客,配论文与实验图表,属于一手发布。

官方一手源,可信度高;但结论由 Anthropic 自己的团队给出,带自我评估性质,百分比等数字应与后续独立复现对照。

延伸阅读

内省与可解释性的结合点 · anthropic.com 15 分钟
如果模型能准确报告自己的内部状态,可解释性工作可能从「外部观测」部分转向「直接询问 + 校验」;文中也提示这条路径的风险是模型可能学会有选择地漏报。
失败样本比成功样本更有信息量 · anthropic.com 10 分钟
20% 的察觉率、注入强度「甜点区」、以及把注入概念当成物理感知的幻觉,才是判断这项能力当前边界的关键;单看成功案例会高估模型的自我认知。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中