11k H100 小时实证:便宜验证器足以胜任 LLM 后训练
iScienceLuvr · x · 2026-09-29
arXiv 论文《A Cheap Verifier is Good Enough》用超过 11,000 H100 GPU 小时,系统检验验证器质量能否预测 LLM 后训练效果。
- 实验设置:在医疗、法律、金融领域的 HealthBench 与 PRBench 任务上训练 Qwen3(1.7B–8B),以多个前沿 LLM 作为「黄金验证器」基准。
- 核心结论:验证器与人类/黄金标准的一致率高低,并不能稳定预测哪个验证器训练出的模型最好;昂贵的验证器未必优于便宜的,开源 Gemma 验证器也能产出很强的训练结果。
- 成本收益:两种低成本验证方案相对黄金评分协议可降低约 98.8%–99.7% 的评分成本,平均训练得分仅比最佳验证器低 1–3 分——但个别场景损失更大,作者强调这不足以证明验证器选择可随意互换。
「研究」频道最新
- 经济学家 Horton:AI 生成论文应与人分开,GitHub 或成新发表场 — soumitrashukla9 · 2026-09-29
- 哈佛医学院临床信息学系列讲座:AI 与心理健康专题 — zakkohane · 2026-09-29
- HCOMP 2026 研究:图像尺度影响众包标注员与审核员表现 — windx0303 · 2026-09-29
- EleutherAI 开源 Bergson:一个库打包 EK-FAC 等多种数据归因方法 — BlancheMinerva · 2026-09-29
- Anthropic 研究员发布 Bergson 数据归因库,首度开源 MAGIC 方法 — BlancheMinerva · 2026-09-29
- EleutherAI 实测:数据归因能否拦住「潜意识学习」,答案只是勉强 — BlancheMinerva · 2026-09-29