提议用安全分类器过滤推理轨迹,改进对齐 SFT

xuanalogue · x · 2026-07-22

承接中美训练路径差异的讨论,作者提出一种对齐推理模型的思路:如果在对成功的推理轨迹进行 SFT 之前,不仅按“成功”过滤,还引入安全分类器(如 OpenAI 在部署中使用的分类器)来过滤对齐性,或许能在避免 RL 病态的同时,训练出安全对齐的推理模型。

所属事件:中美大模型训练路径分化:美国重RL,中国偏好SFT(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →