R-Quest 论文:用问题有效性与新颖性反馈终结自进化模型的性能崩塌
HINT-lab · hf · 2026-10-08
HINT-lab 论文研究推理模型自进化(用自生成问题自我训练)为何多轮后性能崩塌:
- 两大病因:无效问题比例随轮次上升(answer-consistency 过滤反而加剧);基于词面相似度的多样性控制识别不出「表述不同但数学等价」的重复问题,导致后期多样性崩塌。
- R-Quest 方法:先训练 solver 识别并拒绝无效问题,用其判断给 questioner 发奖励信号并过滤 solver 训练数据;再用冻结的基础模型对采样问题两两比较提供新颖性反馈。
- 效果:在 12 个数学推理、通用推理与代码生成基准上两个模型家族平均分最高,连续十轮自进化保持稳定增益,最终轮达到峰值,比 R-Zero 高 17.32 分。
「研究」频道最新
- 以太坊研究员 Justin Drake 呼吁行业转入「地堡模式」应对数学进步风险 — marcvanderchijs · 2026-10-08
- Lean 证明疑与论文不一一对应,GPT 形式化被指对难证引理抄近路 — ctjlewis · 2026-10-08
- Alignment Whack-a-Mole 获 COLM 2026 oral,作者预告对谈节目 — TuhinChakr · 2026-10-08
- OpenAI 疑似证明虚二次域模性猜想,CM 数域椭圆曲线或将全部模性 — soumitrashukla9 · 2026-10-08
- OpenAI 一天发 722 篇数学论文,过半引用自家工作且现引用环 — aran_nayebi · 2026-10-08
- 数学家发现 AI 洞见藏在既有思想的凸包里,其余科学也将在更大规模迎来这一课 — soumitrashukla9 · 2026-10-08