[
](https://huggingface.co#how-uk-aisi-and-evaleval-are-making-benchmark-results-reproducible)
英国 AISI 与 EvalEval 如何让基准测试结果可复现
EvalEval 联盟非常高兴地分享,英国人工智能安全研究所(AISI)正在使用 EvalEval 的基础设施公开分享评估结果,以支持更可复现、更可验证的评估科学。
AISI 与 EvalEval 此前曾合作开展研究,该研究始于 与 NeurIPS 2025 同期举办的联合研讨会,来自该研究所的反馈也帮助塑造了 Every Eval Ever(EEE)模式。合作的下一阶段将把这一共享基础设施付诸实践。
[
](https://huggingface.co#why-reproducible-evaluation-reporting-matters)
为什么可复现的评估报告很重要
随着人工智能部署加速,评估正日益成为关于模型和系统性能的重要证据来源。然而,结果以多种格式、平台和渠道报告,往往缺乏足够的信息来复现它们。重新运行这些评估本身可能就成本高昂到令人却步。
EvalEval 的使命是通过共享报告模式 Every Eval Ever 和开放平台 Evaluation Cards,将评估结果以及解读它们所需的信息纳入一个共同结构,从而改善这一生态系统。
这自然地建立在 AISI 的工作之上:通过 OptStop 让评估更高效,通过 HiBayES 让评估在统计上更严谨,并在转录分析、能力激发等领域更加标准化。AISI 与 EvalEval 正携手诊断评估报告中的缺口,并构建共享基础设施来弥合这些缺口。
[
](https://huggingface.co#what-aisi-is-sharing)
AISI 正在分享什么
转录级别的透明度不仅对可复现性很重要,对分析和诊断也很重要。在这一新的合作阶段,AISI 正在酌情通过 Evaluation Cards 公开已报告的评估方法和发现。此次发布包含论文主实验中五个基准测试的经过验证的结果、背景和配置信息:
- HealthBench
- FrontierMath
- Humanity's Last Exam
- SWE-Bench Pro
- Terminal-Bench 2.0
这些结果涵盖六个前沿模型:Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2 和 GPT-5.4。此次发布还包含两项相关网络评估——Cyber CTFs 和 The Last Ones——的结果,它们使用了一组不同且部分重叠的模型。这些数据随 AISI 的论文 《推理计算如何塑造前沿 LLM 评估》 一同发布,该论文研究基准测试性能如何取决于推理时计算和评估协议。
“人类最后的考试”上的表现会随评估协议和推理计算量的变化而变化。每条曲线展示了在给定 token 数量内已解决任务的累计占比,采用每个任务最早观察到的成功结果。当模型在每次尝试后收到来自 oracle 的正确性反馈时,随着 token 使用量增加,它们会继续解决更多任务。
当结果连同设置信息一起公开时,研究人员和从业者可以更仔细地审视单项研究,并在更广泛的生态系统中比较各项发现。在其他报告缺乏这些细节的情况下,像 AISI 这样的发布提供了经过验证的参考点,用于在具体情境中解读评估——例如,帮助研究人员理解设置选择可能如何影响所报告的表现。随着更多评估者采用 EEE,像这样的开放比较可以支持更广泛、更可靠的元研究。
AISI 的 Terminal-Bench 2.0 结果,以及同一批模型在不同评估设置下的其他已报告评估结果。
我们对这一采用感到兴奋,并期待与 AISI 及其他 AI 评估组织进一步标准化和共享评估。
[
](https://huggingface.co#contribute-to-the-shared-mission)
为共同使命做出贡献
模型开发者:报告经过验证的评估结果。评估开发者:使用 Every Eval Ever schema 报告基准测试和运行数据。评估、治理和政策研究人员:探索评估卡片,按基准测试或模型查看,或用它来整体考察评估报告的现状。
[
](https://huggingface.co#about-the-evaleval-coalition)
关于 EvalEval 联盟
EvalEval 联盟是一个研究社区,致力于为评估生态系统开发有科学依据的研究和稳健的部署基础设施。其目标是改进评估科学,解决在记录评估适用性和实用性方面缺乏共识的问题,并扩大对科学研究和政策分析重要影响的覆盖范围。
该联盟的旗舰项目包括 Every Eval Ever,这是一个用于评估结果的共享 schema 和存储库,以及 Evaluation Cards,它将基准测试元数据、评估运行数据和模型元数据组合成可解释的记录。二者共同使人们更容易理解,看似相似的分数是在何种有实质差异的条件下产生的。
[
](https://huggingface.co#about-the-uk-ai-security-institute)
关于英国 AI 安全研究所
英国 AI 安全研究所 是英国政府科学、创新与技术部下属的一个研究机构。其使命是让各国政府对先进 AI 所带来的风险具备科学理解。AISI 开展研究并建设基础设施,以理解先进 AI 的能力和影响、开发和测试缓解措施,并为政策提供依据。
