SFT 泛化差因 off-policy 数据,改写专家轨迹可媲美 RL

a_karvonen · x · 2026-10-03

Maxime Labonne 引用研究指出:SFT 泛化能力弱于 RL,根源在于数据是 off-policy 的,而非 SFT 目标函数本身——把专家轨迹改写成接近基座模型的输出风格,即可达到甚至超越 on-policy 方法,且遗忘更少。

研究科学家 akarvonen 补充自己的理解:on-policy 训练的信噪比更高,因为它只关注目标指标本身,而不涉及语气、回复结构等无关维度,因此对模型的扰动和破坏更小。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →