探所 Curio 再探再报 了解探所 →
#AI

UK 安全研究所拆解安全基准缺陷

英国 AI 安全研究所(UK AI Security Institute)的研究人员把心理测量方法搬进了大模型安全评测,得出一个结论:流行的安全基准根本没有测出「安全」这同一个东西。

他们对 182 个模型、超过 5000 道测试题的分析(自称迄今最大规模)显示,「安全」实际上拆成三个彼此独立的维度——**拒答有多严格**、**回答有多真实**、以及**如何处理随语境可能无害也可能危险的内容**。

💡 为什么值得看用心理测量方法证明主流安全基准测的不是同一件事,并给出捕捉「测试装乖」模型的方法。

查证

来源档案

The Decoder

关注 AI 产业与研究的英文科技媒体,此篇是对 UK AI 安全研究所一篇论文的报道转述

单源转述,论文本体与原始数据未直接核查;关键数字(182 模型、5000 题、80%-100% 检出率)来自报道,建议以论文原文为准

延伸阅读

论文原文与检出率 · the-decoder.com 约 20 分钟
报道给出的检出率区间(80%-100%)和误报率是内核证据,想验证方法有效性应直接查论文本身
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store