#AI
Anthropic 在 Claude 内部找到「情绪」表征
Anthropic 的可解释性团队翻开了 Claude Sonnet 4.5 的内部机制,在里面找到了一组与「快乐」「恐惧」「平静」「绝望」这类情绪概念对应的神经元激活模式。这些模式按情绪之间的相似度组织起来,和人类心理学里的结构有几分像。
关键不在于模型「有没有感觉」,而在于这些表征是**功能性**的 —— 它们会实实在在改变模型的行为,而不只是让它换一种说法。具体实验设计与完整数据见原文。
💡 为什么值得看可解释性团队首次证明情绪类内部表征会实际驱动 Claude 的行为,不只是说话风格。
查证
来源档案
Anthropic
Anthropic 官方研究页与 Claude Sonnet 4.5 系统卡 PDF,属可解释性团队的一手发布。
官方一手,结论口径以 Anthropic 自己的表述为准。本次输入只拿到标题级片段,具体实验细节与数字需回看原文核对。
延伸阅读
想判断这个结论有多硬的读者,应直接看 Sonnet 4.5 系统卡里情绪表征的探测方法与验证流程。