仅凭少量运行评分易误导,谷歌研究提出 RL 评测新指标

burkov · x · 2026-08-26

深度强化学习实验成本高昂,研究者常因预算限制仅进行少量独立训练,但随机性极易导致算法优劣判断出错。Google Research 与蒙特利尔大学的研究通过大规模 Atari 实验复现,证实了传统平均值或中位数评分可能掩盖真实进展。为此,论文提出了在无法进行大量运行时的实用报告方案:使用置信区间显示得分范围、性能分布图展示不同分数段表现,以及四分位均值(IQM)来提高鲁棒性。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →