Google DeepMind 用自生成数据训练 Gemini 自我纠错

heghbalz · x · 2026-07-27

Google DeepMind 提出 SCoRe,让模型学会自我纠错

这篇论文《Training Language Models to Self-Correct via Reinforcement Learning》提出了 SCoRe:一种多轮在线强化学习方法,直接使用模型自己生成的纠错轨迹训练,而不是依赖离线的人类或模型纠错数据。

要点如下:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →