论文:推理模型的安全恢复只需几步早期引导

furongh · x · 2026-07-06

一篇论文《Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away》研究推理模型的安全恢复问题,提出通过在推理早期施加少量引导步(steering steps)即可恢复模型的安全性。该工作属于AI安全与对齐研究方向。

所属事件:新研究指推理模型安全恢复仅需几步引导(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →