#AI
UK AISI 用 EvalEval 公开五个基准评测结果
UK AI Security Institute(AISI)开始借助 EvalEval Coalition 的基础设施公开评测结果,把已公开的方法与发现放上 Evaluation Cards 平台,覆盖 HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro 与 Terminal-Bench 2.0 五个基准。
数据配合其报告《How Inference Compute Shapes Frontier LLM Evaluation》,研究基准成绩如何随推理期算力与评测协议变化,为不同评测设置下的分数比较提供可核验参照点。
💡 为什么值得看公开报告常缺可核验结果;这次给出配置与上下文,换库比分更可信。
查证
来源档案
EvalEval Coalition 官方博客
非营利研究联盟 EvalEval Coalition 在 Hugging Face 博客发布的合作公告,介绍 UK AISI 采用其 Every Eval Ever schema 与 Evaluation Cards 平台公开评测结果。
一手官方公告,信任度较高。但这是一份站方对自身基础设施的宣传性介绍,基准成绩本身与论文细节需回到 AISI 的论文及 Evaluation Cards 页面核对。
延伸阅读
可直接按基准或模型检索 AISI 的配置与结果记录,自己判断哪些分数可比、哪些不可比。
HLE 曲线说明评测协议与算力预算能显着改变结论,选型时值得对照自己用的设置。