探所 Curio 再探再报 了解探所 →
#AI

Anthropic 发布 persona vectors,监测模型性格漂移

Anthropic 发布新研究,提出 **persona vectors** —— 模型神经网络里控制「性格特征」的激活模式,可以粗略类比成人大脑里对应不同情绪与态度的区域。

提取方式很直接:给一个特征(evil、sycophancy、hallucination 等),自动生成正反两套提示,对比模型表现出该特征与不表现时的神经活动差异,差值就是这条矢量。

💡 为什么值得看把模型性格量化成神经矢量,可监测也可干预。

查证

来源档案

Anthropic Research(官方博客)

Anthropic 官方研究博客,配套一篇完整论文,属于公司自己发布的一手研究成果。

官方一手,事实层可直接采信;但实验均在两个小规模开源模型上完成,能力与规模是否能外推到 Claude 这一档前沿模型,官方博客没有给出证据,相关效果声明按单一来源处理。

延伸阅读

预防性 steering 的机制 · anthropic.com 15 分钟
官方称训练时主动注入坏矢量反而提升抗性、且不伤 MMLU —— 这个反直觉结论是全文最值得读的一节,方法论和 ablation 细节只在论文里。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store