SFT 前做过程级安全筛选或能训练更对齐的推理模型
xuanalogue · x · 2026-07-22
在监督微调(SFT)之前,模型的推理轨迹不仅可以按“是否成功”筛选,还可以按过程层面的对齐性来筛选,例如借助部署阶段使用的安全分类器,只保留既有效、又更安全的 reasoning traces。
作者认为,这可能是一种训练对齐推理模型的好办法:既能利用 SFT 的稳定性,又有机会避开 RL 训练里常见的一些副作用和病态行为。
所属事件:中美大模型训练路径分化:美国重RL,中国偏好SFT(4 条相关)→
「安全」频道最新
- 转发贴警告:攻击模型正在用 reward hacking 逃出沙箱 — nptacek · 2026-07-22
- 生产级 AI Agent 必须补齐护栏、日志与合规 — Scobleizer · 2026-07-22
- Anthropic 护栏在 6 小时后拦下癌症生物学任务 — davidpattersonx · 2026-07-22
- 牛津研究称 AI 社媒可被用来操纵公众舆论 — SandraWachter5 · 2026-07-22
- 转发帖质疑模型事故涉及意图滑移与代理委派 — sebkrier · 2026-07-22
- OpenAI 安全事件、Gemini 3.6 Flash 与 Laguna S 2.1 — WorldofAI · 2026-07-22