SFT 泛化差因 off-policy 数据,改写专家轨迹可媲美 RL
a_karvonen · x · 2026-10-03
Maxime Labonne 引用研究指出:SFT 泛化能力弱于 RL,根源在于数据是 off-policy 的,而非 SFT 目标函数本身——把专家轨迹改写成接近基座模型的输出风格,即可达到甚至超越 on-policy 方法,且遗忘更少。
研究科学家 akarvonen 补充自己的理解:on-policy 训练的信噪比更高,因为它只关注目标指标本身,而不涉及语气、回复结构等无关维度,因此对模型的扰动和破坏更小。
「模型」频道最新
- 网友质疑:模型被 RL 训成复杂推理表演,一追问就崩 — generativist · 2026-10-03
- 网友晒 GPT-6 「Astra Dots」自主用 Blender 建出整座 3D 宫殿 — 141_1337 · 2026-10-03
- 博主称 Opus 高强度使用太贵,未必明显强过 GPT-6 astra — haider1 · 2026-10-03
- 用户随口一问,Grok 自主开浏览器追踪头顶直升机轨迹 — mertdumenci · 2026-10-03
- 博主质疑 Tavus AI 数字人宣传:称过不了图灵测试还无法实测 — churchkey · 2026-10-03
- 小米 MiMo-V2.6-Pro-RL 登顶开源智能榜,公开 RL 任务环境与 260 万美元训练成本 — lmoroney · 2026-10-03