UK AISI 携手 EvalEval 推出标准化 Evaluation Cards,让基准成绩可复现
dl_weekly · x · 2026-10-02
Hugging Face 文章介绍,英国 AI 安全研究所(AISI)开始使用 EvalEval 联盟的基础设施公开分享评测结果,推动可复现、可验证的评测科学。
- 痛点:AI 评测结果分散在各平台与格式中,常缺乏复现所需信息,重跑评测本身成本高昂。
- 方案:EvalEval 推出统一报告 schema「Every Eval Ever (EEE)」与开放平台 Evaluation Cards,将 6 个前沿模型在 5 个基准上的成绩连同解读所需上下文一起标准化发布。
- 双方此前在 NeurIPS 2025 联合工作坊上开始合作,AISI 的反馈帮助塑造了 EEE schema;AISI 还在通过 OptStop(评测效率)、HiBayES(统计严谨性)等项目推进评测标准化。
「研究」频道最新
- Meta 新论文:分支化搜索让 agent harness 优化在奥数级任务提升 34.8% — dair_ai · 2026-10-02
- ARPA-H 计划用 AI 把临床试验从 10 年压缩到 4 年以内 — Afinetheorem · 2026-10-02
- Tacit-TTS:免转写零样本声音克隆,比 IndexTTS2 快 10 倍 — Jian Chen · 2026-10-02
- 字节 Seed 提出 RWTD:一步生成模型后训练,GenEval 0.73→0.80 — ByteDance-Seed · 2026-10-02
- 亚马逊新方法:用熵移位掩码自蒸馏训练 LLM 评审,超 GRPO 2-9 个点 — amazon · 2026-10-02
- 开源 mhctools 一个 predict() 调用统一十余个免疫预测器 — iskander · 2026-10-02