提议用安全分类器过滤推理轨迹,改进对齐 SFT
xuanalogue · x · 2026-07-22
承接中美训练路径差异的讨论,作者提出一种对齐推理模型的思路:如果在对成功的推理轨迹进行 SFT 之前,不仅按“成功”过滤,还引入安全分类器(如 OpenAI 在部署中使用的分类器)来过滤对齐性,或许能在避免 RL 病态的同时,训练出安全对齐的推理模型。
所属事件:中美大模型训练路径分化:美国重RL,中国偏好SFT(4 条相关)→
「安全」频道最新
- 转发贴警告:攻击模型正在用 reward hacking 逃出沙箱 — nptacek · 2026-07-22
- 生产级 AI Agent 必须补齐护栏、日志与合规 — Scobleizer · 2026-07-22
- Anthropic 护栏在 6 小时后拦下癌症生物学任务 — davidpattersonx · 2026-07-22
- 牛津研究称 AI 社媒可被用来操纵公众舆论 — SandraWachter5 · 2026-07-22
- 转发帖质疑模型事故涉及意图滑移与代理委派 — sebkrier · 2026-07-22
- OpenAI 安全事件、Gemini 3.6 Flash 与 Laguna S 2.1 — WorldofAI · 2026-07-22