Math-Shepherd 用 rollout 替代 80 万人标注,GSM8K 升至 84.1%
le_james94 · x · 2026-09-16
该推文(验证器讨论串的上游)介绍验证成为核心任务的背景:过程奖励模型给每个推理步骤打分,训练一个曾需要 800,000 条人类标注;Math-Shepherd 用 rollout 替代标注者——一步好不好,取决于模型能否从这一步仍然到达正确答案——由此把 GSM8K 成绩从 77.9% 提升到 84.1%。
所属事件:采样威力:重复生成大幅提升AI解题率(2 条相关)→
「研究」频道最新
- 多智能体 RL 后训练破解 LLM 模式坍缩,提升回答多样性 — natashajaques · 2026-09-16
- 观点:世界模型到不了 AGI,持续学习才是最后也是最难的一块拼图 — Intelligent-Cream-14 · 2026-09-16
- 哲学家新书附录论证:为何可确信当下 LLM 并无意识 — AnnaCiaunica · 2026-09-16
- 普林斯顿造出光可编程「可擦写」超薄半导体,仅数分子厚 — MengdiWang10 · 2026-09-16
- ICML 2026 Oral:黎曼度量匹配让扩散几何估计快 400 倍 — allen_ai · 2026-09-16
- 655k 论文提取 600 万科学贡献,EMNLP 论文发布科学贡献图谱数据集 — mmbronstein · 2026-09-16