Best-of-N 采样实测:数学题准确率提升至 65%
SergioPaniego · x · 2026-08-23
Hugging Face 分享了一份关于 Agent 通过 Best-of-N 采样与奖励模型解决数学题的实测报告。实验使用 Qwen2.5-1.5B 作为生成模型,Skywork PRM 作为打分模型。结果显示,加权 Best-of-N (N=16) 在 MATH 测试集上达到 65% 的准确率,显著优于贪婪解码的 45%。该方法通过采样多个解、分组打分并加权投票,能有效从少量出现甚至非众选的答案中抢救出正确结果。
「研究」频道最新
- 鸟类磁场导航机制研究:争议与媒体误读 — NikoMcCarty · 2026-08-23
- ICRA 2026 论文 PROFusion:鲁棒实时的稠密场景重建 — rsasaki0109 · 2026-08-23
- AI 评估专家:自底向上评估很难,AI 不擅长 — petergyang · 2026-08-23
- 手算图卷积网络:12 步搞懂 Transformer 表亲 — ProfTomYeh · 2026-08-23
- Napster 全面转型 AI 代理,暴露 LLM 训练数据过时的硬伤 — Tanmay_Vermaa · 2026-08-23
- ICML 2026 论文:OpticalDNA 借鉴 OCR 将基因组转为 2D 图像 — jiqizhixin · 2026-08-23