自训练别只留正确答案:策略多样性采样提升pass@k
PMinervini · x · 2026-10-04
爱丁堡大学等研究者的工作提出:自训练数据不该只靠独立采样后保留正确答案(RFT),而应先让模型给出多种不同解题思路,再按每种思路各写一份完整解答。
- 问题:在难题上(64 次里最多解出 2 次的前沿题),IID 采样容易模式坍缩、反复用同一策略,微调后行为几乎不变。Qwen3-4B-Instruct 每题 4 个样本时 held-out pass@64 仅 5.2,即使 64 个样本、温度 1.5 也只到 7.9。
- 方法:两种获取思路的方式——GROOT(让模型写出解题思路决策树,取 n 条根到叶路径)与 Verbalized Sampling(列出一组思路),再让模型按每条思路各解一次。
- 结论:策略多样化的采样数据能带来更好的 pass@k、测试时扩展与 RL 初始化效果。
「研究」频道最新
- 12 封拿破仑时代密电被破译:密码本按字母序排列成破局关键 — apples_jimmy · 2026-10-05
- 网友借 AI 破译拿破仑三世 1859 年私电密码,尘封百年首度公开 — apples_jimmy · 2026-10-05
- 「轮廓谬误」:仿神经元结构不等于继承其计算能力 — neurovium · 2026-10-05
- 自建仿真管线:不同竞赛无人机几何构型的圈速对决 — DominiqueCAPaul · 2026-10-05
- 研究者激辩RL泛化边界:若泛化够强,前沿实验室何必造环境 — brianryhuang · 2026-10-05
- ScholarCatalyst 基准:前沿模型难辨哪篇旧论文能启发新研究 — CatAstro_Piyush · 2026-10-05