SFT 前做过程级安全筛选或能训练更对齐的推理模型

xuanalogue · x · 2026-07-22

在监督微调(SFT)之前,模型的推理轨迹不仅可以按“是否成功”筛选,还可以按过程层面的对齐性来筛选,例如借助部署阶段使用的安全分类器,只保留既有效、又更安全的 reasoning traces。

作者认为,这可能是一种训练对齐推理模型的好办法:既能利用 SFT 的稳定性,又有机会避开 RL 训练里常见的一些副作用和病态行为。

所属事件:中美大模型训练路径分化:美国重RL,中国偏好SFT(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →