#AI
KAIST 研究:模型推理步骤在内层可分离
韩国 KAIST 与 Naver AI Lab 的一项新研究给出结论:模型在文字里表现出的推理步骤,在它的数值表征里也能被分开,而且**中间层的信号最清楚**。
研究团队先定义了 8 种反复出现的推理操作 —— 提取、分解、公式回忆、演绎、计算等,让 Qwen2.5-7B、Qwen3-8B、Gemma4-31B 三个模型解数学题,把解题路径切成片段,再用 GPT-5 给每段打上操作标签。
💡 为什么值得看中间层有词面难解释的内部表征,模型内部加工多于可见思维链。
研究的边界与延伸
- **错误样本**:即使题目最终解错,模型当时在执行哪类步骤仍可被识别 —— 错误的计算步骤在内部依然「长得像」计算步骤。
- **可复现性**:结论在 Llama-3-8B 上复现;对 Qwen3-8B,训练出的分类器成功迁移到 GPQA-Diamond 与 MATH-500。
- **研究局限**:实验仅限于数学任务和少数几个模型。这些发现能否用来捕获错误,或在生成中途引导模型,仍是未解的问题。
查证
来源档案
The Decoder
AI 领域科技媒体,本篇是对 KAIST / Naver AI Lab 一篇新研究的转述报道,含研究者的实验设计、图表与结论概述,文末附订阅推广。
单源二手报道,正文对实验细节(模型、8 种操作、中间层信号、词面控制、注意力干预)描述较具体,但未给出论文链接或 arXiv 编号;研究尚未见官方一手公告或第二家媒体跟进,按线索档处理。
延伸阅读
报道把该研究接到一条更大的线索上:OpenAI 视思维链为少数可用监督手段之一,而 Anthropic 显示模型只在 25%–39% 的情况下披露它用到的线索。这类「内部状态 → 可读」的研究若成立,指向的是监督手段本身的可靠边界,值得顺着原文的引用链往下读。
研究测的是表征层面的可分性,不是可用于干预的因果机制。想判断它对 AI safety 的实际分量,需要区分「能读出步骤类型」和「能在生成中途纠偏」——报道明确把后者列为未解问题。