探所 Curio 再探再报 了解探所 →
#AI

UK AISI 用 EvalEval 公开五个基准评测结果

UK AI Security Institute(AISI)开始借助 EvalEval Coalition 的基础设施公开评测结果,把已公开的方法与发现放上 Evaluation Cards 平台,覆盖 HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro 与 Terminal-Bench 2.0 五个基准。

数据配合其报告《How Inference Compute Shapes Frontier LLM Evaluation》,研究基准成绩如何随推理期算力与评测协议变化,为不同评测设置下的分数比较提供可核验参照点。

💡 为什么值得看公开报告常缺可核验结果;这次给出配置与上下文,换库比分更可信。

查证

来源档案

EvalEval Coalition 官方博客

非营利研究联盟 EvalEval Coalition 在 Hugging Face 博客发布的合作公告,介绍 UK AISI 采用其 Every Eval Ever schema 与 Evaluation Cards 平台公开评测结果。

一手官方公告,信任度较高。但这是一份站方对自身基础设施的宣传性介绍,基准成绩本身与论文细节需回到 AISI 的论文及 Evaluation Cards 页面核对。

延伸阅读

去 Evaluation Cards 按基准查 · huggingface.co 10 分钟
可直接按基准或模型检索 AISI 的配置与结果记录,自己判断哪些分数可比、哪些不可比。
读 AISI 那份推理算力论文 · huggingface.co 20 分钟
HLE 曲线说明评测协议与算力预算能显着改变结论,选型时值得对照自己用的设置。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中