#AI
Anthropic 发布 persona vectors,监测模型性格漂移
Anthropic 发布新研究,提出 **persona vectors** —— 模型神经网络里控制「性格特征」的激活模式,可以粗略类比成人大脑里对应不同情绪与态度的区域。
提取方式很直接:给一个特征(evil、sycophancy、hallucination 等),自动生成正反两套提示,对比模型表现出该特征与不表现时的神经活动差异,差值就是这条矢量。
💡 为什么值得看把模型性格量化成神经矢量,可监测也可干预。
查证
来源档案
Anthropic Research(官方博客)
Anthropic 官方研究博客,配套一篇完整论文,属于公司自己发布的一手研究成果。
官方一手,事实层可直接采信;但实验均在两个小规模开源模型上完成,能力与规模是否能外推到 Claude 这一档前沿模型,官方博客没有给出证据,相关效果声明按单一来源处理。
延伸阅读
官方称训练时主动注入坏矢量反而提升抗性、且不伤 MMLU —— 这个反直觉结论是全文最值得读的一节,方法论和 ablation 细节只在论文里。