采样威力:重复生成大幅提升AI解题率

讨论指出过程奖励模型给每个推理步骤打分,训练曾需要 80 万条人类标注,而 Math-Shepherd 用 rollout 替代人工,将 GSM8K 提升至 84.1%。类似效应也出现在 SWE-bench 实测:DeepSeek-Coder-V2-Instruct 单次采样仅解决 15.9% 的问题,采样 250 次后升至 56%,显示生成器潜力远超单次表现。

2026-09-16 ~ 2026-09-16 · 2 条相关