Google DeepMind 用自生成数据训练 Gemini 自我纠错
heghbalz · x · 2026-07-27
Google DeepMind 提出 SCoRe,让模型学会自我纠错
这篇论文《Training Language Models to Self-Correct via Reinforcement Learning》提出了 SCoRe:一种多轮在线强化学习方法,直接使用模型自己生成的纠错轨迹训练,而不是依赖离线的人类或模型纠错数据。
要点如下:
- 作者认为,传统在纠错轨迹上做 SFT 往往会失败,原因主要是 训练/测试分布不一致,或出现 行为塌缩。
- SCoRe 让训练数据来自模型自己的分布,减少了训练和测试时的偏差。
- 第一阶段 通过多轮 RL 和 KL 约束稳定训练,让第一轮回答尽量贴近基座模型,同时让第二轮主要学习纠错。
- 第二阶段 给“相对第一次回答的改进”额外奖励,强化自我修正能力。
- 论文称,在 Gemini 1.0 Pro 和 Gemini 1.5 Flash 上,方法分别让 MATH 与 HumanEval 的自我纠错能力提升 15.6% 和 9.1%。
「研究」频道最新
- 开源基准工具可安全统计 coding agent token 消耗 — bestofdesp · 2026-07-28
- 研究者回应审稿:观察性数据也能做因果推断 — yanaiela · 2026-07-28
- 更强模型也可能拖垮产品,先做生产任务测试 — max_gladysh · 2026-07-28
- RepLLM 用四个智能体把网络论文复现压到两小时内 — 机器之心 · 2026-07-28
- Vision-OPD 用 6.2K 合成样本提升细粒度视觉理解 — 小红书技术REDtech · 2026-07-28
- 论文称冻结 12B 模型可零 token 重跑已验证程序 — MindPsychological140 · 2026-07-28