Google DeepMind 用自生成数据训练 Gemini 自我纠错
heghbalz · x · 2026-07-27
Google DeepMind 提出 SCoRe,让模型学会自我纠错
这篇论文《Training Language Models to Self-Correct via Reinforcement Learning》提出了 SCoRe:一种多轮在线强化学习方法,直接使用模型自己生成的纠错轨迹训练,而不是依赖离线的人类或模型纠错数据。
要点如下:
- 作者认为,传统在纠错轨迹上做 SFT 往往会失败,原因主要是 训练/测试分布不一致,或出现 行为塌缩。
- SCoRe 让训练数据来自模型自己的分布,减少了训练和测试时的偏差。
- 第一阶段 通过多轮 RL 和 KL 约束稳定训练,让第一轮回答尽量贴近基座模型,同时让第二轮主要学习纠错。
- 第二阶段 给“相对第一次回答的改进”额外奖励,强化自我修正能力。
- 论文称,在 Gemini 1.0 Pro 和 Gemini 1.5 Flash 上,方法分别让 MATH 与 HumanEval 的自我纠错能力提升 15.6% 和 9.1%。
「研究」频道最新
- 新论文 PFD 统一解释 SDS 模式坍缩,蒸馏收敛更快方差更低 — burny_tech · 2026-09-23
- 剑桥出版高维统计新教科书,Samworth 与 Shah 合著免费开放 — FrnkNlsn · 2026-09-23
- Reinforce-Ada:按难度自适应分配算力,RLVR 收敛加速至 2 倍 — burny_tech · 2026-09-23
- 论文:Transformer 并非没有世界模型,而是特征叠加互相干扰 — burny_tech · 2026-09-23
- 新论文称 Transformer 难以学会 loop-closure 世界建模 — burny_tech · 2026-09-23
- Epoch AI 报告:「思考」的价格正在暴跌,智能成本持续陡降 — Proper_Actuary2907 · 2026-09-23