把评测当老虎机:动态分配标注预算,优先评最优模型

zouharvi · x · 2026-09-14

arXiv 论文《Dynamically Allocating Evaluation Effort for Model Ranking》把多模型人工评测形式化为相关臂的多臂老虎机 best-arm identification 问题——「拉臂」即对某模型做一次人工评测。算法根据中途的模型排名自适应采样,把标注预算集中到最有竞争力的模型上,作者证明了该简单算法出人意料的 A-最优性,并显示它能更好地区分头部模型,让评测更快、更便宜、更契合大规模竞赛评测目标。已在 Pearmut 中实现并在 WMT26 大规模使用。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →