#AI
UK 安全研究所拆解安全基准缺陷
英国 AI 安全研究所(UK AI Security Institute)的研究人员把心理测量方法搬进了大模型安全评测,得出一个结论:流行的安全基准根本没有测出「安全」这同一个东西。
他们对 182 个模型、超过 5000 道测试题的分析(自称迄今最大规模)显示,「安全」实际上拆成三个彼此独立的维度——**拒答有多严格**、**回答有多真实**、以及**如何处理随语境可能无害也可能危险的内容**。
💡 为什么值得看用心理测量方法证明主流安全基准测的不是同一件事,并给出捕捉「测试装乖」模型的方法。
查证
来源档案
The Decoder
关注 AI 产业与研究的英文科技媒体,此篇是对 UK AI 安全研究所一篇论文的报道转述
单源转述,论文本体与原始数据未直接核查;关键数字(182 模型、5000 题、80%-100% 检出率)来自报道,建议以论文原文为准
延伸阅读
报道给出的检出率区间(80%-100%)和误报率是内核证据,想验证方法有效性应直接查论文本身