#AI
研究者改写 Claude 内部概念,答案从 8 变 6
研究者对 Claude 做了一次有点直接的操作:先问它「会结网的动物有几条腿?」,发现模型内部短暂激活了「蜘蛛」这个概念——虽然它并没有把「蜘蛛」这两个字输出出来。接着他们在该激活位置用**同等强度的「蚂蚁」替换掉「蜘蛛」**,其余参数保持不变。
模型的答案从「8」变成了「6」。这组结果的意义在于:被改的不是提示词,也不是最终输出层,而是模型推理链条中一个**未说出口的中间表征**,而输出随之改变。该实验被描述为首次实现对中间思维过程的精准编辑,指向黑箱内部的概念表征与逻辑输出之间存在因果关联。
💡 为什么值得看把「模型内部想什幺」与「最终答什幺」直接连起来的实验,比输出层提示词更深。
查证
来源档案
BAAI 社区的社区转述帖
中文社区的一条聚合 / 转述帖,链到 hub.baai.ac.cn 的文章页,本身不是论文或官方公告。
属于线索档:单一非权威来源的转述,原始论文 / 研究团队与具体方法细节都没在素材里给出,不宜当作已确认的学术结论。
延伸阅读
社区帖只给了结论,方法(激活定位方式、单点替换的可复现性)要看一手论文才能判断。