探所 Curio 再探再报 了解探所 →
#AI

研究者改写 Claude 内部概念,答案从 8 变 6

研究者对 Claude 做了一次有点直接的操作:先问它「会结网的动物有几条腿?」,发现模型内部短暂激活了「蜘蛛」这个概念——虽然它并没有把「蜘蛛」这两个字输出出来。接着他们在该激活位置用**同等强度的「蚂蚁」替换掉「蜘蛛」**,其余参数保持不变。

模型的答案从「8」变成了「6」。这组结果的意义在于:被改的不是提示词,也不是最终输出层,而是模型推理链条中一个**未说出口的中间表征**,而输出随之改变。该实验被描述为首次实现对中间思维过程的精准编辑,指向黑箱内部的概念表征与逻辑输出之间存在因果关联。

💡 为什么值得看把「模型内部想什幺」与「最终答什幺」直接连起来的实验,比输出层提示词更深。

查证

来源档案

BAAI 社区的社区转述帖

中文社区的一条聚合 / 转述帖,链到 hub.baai.ac.cn 的文章页,本身不是论文或官方公告。

属于线索档:单一非权威来源的转述,原始论文 / 研究团队与具体方法细节都没在素材里给出,不宜当作已确认的学术结论。

延伸阅读

找原始论文 · link.baai.ac.cn 10 分钟
社区帖只给了结论,方法(激活定位方式、单点替换的可复现性)要看一手论文才能判断。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中