提议用安全分类器过滤推理轨迹,改进对齐 SFT
xuanalogue · x · 2026-07-22
承接中美训练路径差异的讨论,作者提出一种对齐推理模型的思路:如果在对成功的推理轨迹进行 SFT 之前,不仅按“成功”过滤,还引入安全分类器(如 OpenAI 在部署中使用的分类器)来过滤对齐性,或许能在避免 RL 病态的同时,训练出安全对齐的推理模型。
所属事件:中美推理模型训练路径分化与对齐新思路(5 条相关)→
「安全」频道最新
- WIRED 深度:递归自我改进浪潮令前沿实验室研究者恐慌,多人辞职发声 — connoraxiotes · 2026-09-11
- 经济学家:通往安全 AGI 要靠大实验室内部工程师,而非外部踩刹车 — paulnovosad · 2026-09-11
- 安全专家:AI 驱动攻击并无新招,传统防御依然有效 — AccBalanced · 2026-09-11
- 长文反驳 AI 灭绝论:所谓「10% 灭绝风险」是为逃避产品责任 — gerardsans · 2026-09-11
- 数百个 AI 代理围攻 PaperCut 漏洞,GreyNoise 揭示其操作幕后 — AccBalanced · 2026-09-11
- 「警惕自认正义者」:Anthropic 被批肆意访问用户隐私数据 — aiamblichus · 2026-09-11