#AI
Anthropic 称 Claude 有部分内省能力
Anthropic 在官方研究博客发布内省(introspection)研究,称实验提供了「当前 Claude 模型具备一定程度内省意识」的证据,同时强调这一能力**高度不可靠、适用范围有限**,没有证据表明模型能像人类那样或达到人类程度地内省。
方法上,研究团队用「概念注入」(concept injection)把已知含义的神经活动模式塞进不相关的上下文,再问模型有没有察觉到。
💡 为什么值得看Opus 4.1 约 20% 能察觉被注入念头,多数失败。
查证
来源档案
Anthropic Research(introspect…
Anthropic 官方研究博客,配论文与实验图表,属于一手发布。
官方一手源,可信度高;但结论由 Anthropic 自己的团队给出,带自我评估性质,百分比等数字应与后续独立复现对照。
延伸阅读
如果模型能准确报告自己的内部状态,可解释性工作可能从「外部观测」部分转向「直接询问 + 校验」;文中也提示这条路径的风险是模型可能学会有选择地漏报。
20% 的察觉率、注入强度「甜点区」、以及把注入概念当成物理感知的幻觉,才是判断这项能力当前边界的关键;单看成功案例会高估模型的自我认知。