#AI
英 AISI:基准测试低估 AI Agent 真实能力
英国 AI 安全研究所(AISI)的新研究发现,现行基准测试因采用固定 token 预算,系统性低估了 AI agent 的实际能力。在软件工程任务上,当 token 预算从 100 万提升至 1000 万时,成功率激增约 25%;在数学与学术任务上,预算增加到 500 万时成功率提升约 22%。最新前沿模型(包括 GPT-5、GPT-5.5)从额外计算中获益远超旧模型,在 5000 万 token 预算下,前沿模型的时间跨度从约 2 小时跃升至 14 小时,此前以 250 万 token 测算的能力翻倍周期被严重低估,实际翻倍速度可能快 60%。AISI 强调,很多长时任务(如需要人类专家 20 小时的任务)在 3000 万 token 以下没有任何模型能完成,这意味着固定预算直接切断了最难任务的展现。对于 OpenAI 而言,GPT-5 与 GPT-5.5 在最新测试中展现的高预算优势意味着仅看静态分数可能隐藏了真实的能力提升幅度,尤其对依赖自我验证(如代码跑通)的软件开发类 agent 影响最大。AISI 建议评估应改为报告能力曲线而非单一分数,这一转向若被行业采纳,将重塑我们对前沿模型进展的估算方式。
💡 为什么值得看固定 token 预算掩盖前沿模型增长,GPT-5 系列受益尤为明显,影响安全评估。
查证
来源档案
The Decoder
德国专注 AI 行业的科技新闻网站,报道引用 AISI 官方研究。
二线专业媒体,内容基于 AISI 原始博客与论文,数据可信度较高,但非一手信源;报道详细给出了关键实验数字与图表解读。
延伸阅读
阅读完整研究设计、全部实验数据与 AISI 的解释,约 10 分钟