Best-of-N 采样实测:数学题准确率提升至 65%

SergioPaniego · x · 2026-08-23

Hugging Face 分享了一份关于 Agent 通过 Best-of-N 采样与奖励模型解决数学题的实测报告。实验使用 Qwen2.5-1.5B 作为生成模型,Skywork PRM 作为打分模型。结果显示,加权 Best-of-N (N=16) 在 MATH 测试集上达到 65% 的准确率,显著优于贪婪解码的 45%。该方法通过采样多个解、分组打分并加权投票,能有效从少量出现甚至非众选的答案中抢救出正确结果。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →