自训练别只留正确答案:策略多样性采样提升pass@k

PMinervini · x · 2026-10-04

爱丁堡大学等研究者的工作提出:自训练数据不该只靠独立采样后保留正确答案(RFT),而应先让模型给出多种不同解题思路,再按每种思路各写一份完整解答。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →