探所 Curio 再探再报 了解探所 →
#AI

Anthropic 在 Claude 内部找到「情绪」表征

Anthropic 的可解释性团队翻开了 Claude Sonnet 4.5 的内部机制,在里面找到了一组与「快乐」「恐惧」「平静」「绝望」这类情绪概念对应的神经元激活模式。这些模式按情绪之间的相似度组织起来,和人类心理学里的结构有几分像。

关键不在于模型「有没有感觉」,而在于这些表征是**功能性**的 —— 它们会实实在在改变模型的行为,而不只是让它换一种说法。具体实验设计与完整数据见原文。

💡 为什么值得看可解释性团队首次证明情绪类内部表征会实际驱动 Claude 的行为,不只是说话风格。

查证

来源档案

Anthropic

Anthropic 官方研究页与 Claude Sonnet 4.5 系统卡 PDF,属可解释性团队的一手发布。

官方一手,结论口径以 Anthropic 自己的表述为准。本次输入只拿到标题级片段,具体实验细节与数字需回看原文核对。

延伸阅读

原文实验设计 · assets.anthropic.com 15 分钟
想判断这个结论有多硬的读者,应直接看 Sonnet 4.5 系统卡里情绪表征的探测方法与验证流程。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store