英国AISI推出Eval Cards公开评测方法
英国 AI 安全研究所(AISI)与 evaluatingevals 团队合作,推出 Eval Cards 形式公开其评测方法、数据与完整记录,以提升 LLM 评测的可复现性与标准化,平台已收录 67.5 万个评测数据点,首个案例为 inference scaling 论文。同日发布的新论文《How Inference Compute Shapes Frontier LLM Evaluation》指出,固定预算的评测会低估前沿模型,放开推理算力后成绩显著提升。
2026-09-23 ~ 2026-09-23 · 4 条相关
- 英国 AISI 携手评估机构,把官方 AI 评估结果搬上 Eval Cards — IanArawjo · 2026-09-23
- AISI 推出 Eval Cards:公开模型评测的方法、数据与完整记录 — evijit · 2026-09-23
- UK AISI 论文:固定预算评测低估前沿模型,放开推理算力成绩大增 — evijit · 2026-09-23
- AISI 研究者推动评测报告标准化,平台已收录 67.5 万评测数据点 — evijit · 2026-09-23