把评测当老虎机:动态分配标注预算,优先评最优模型
zouharvi · x · 2026-09-14
arXiv 论文《Dynamically Allocating Evaluation Effort for Model Ranking》把多模型人工评测形式化为相关臂的多臂老虎机 best-arm identification 问题——「拉臂」即对某模型做一次人工评测。算法根据中途的模型排名自适应采样,把标注预算集中到最有竞争力的模型上,作者证明了该简单算法出人意料的 A-最优性,并显示它能更好地区分头部模型,让评测更快、更便宜、更契合大规模竞赛评测目标。已在 Pearmut 中实现并在 WMT26 大规模使用。
「研究」频道最新
- LeanDB:用Lean类型系统为SQL数据库加上形式化验证前端 — hargup13 · 2026-09-14
- 研究者激辩:AI 破解癌症若实证有效,arXiv 该不该拒收 — IanArawjo · 2026-09-14
- cESA协议:一次对照标注多个译文,更快更稳的机器翻译人工评测 — zouharvi · 2026-09-14
- WMT评测工具Pearmut取代Appraise,三项评测方法将亮相EMNLP — zouharvi · 2026-09-14
- Looped Flows 论文:扩散去噪+循环推理,ARC-AGI-1 达 58.8% — LucaAmb · 2026-09-14
- rankECE:用相邻排序比较替代分箱,更可靠地度量模型校准误差 — _onionesque · 2026-09-14