推理模型的安全恢复仅需几步引导

furongh · x · 2026-07-07

furongh分享ICML 2026论文,指出推理模型的安全恢复只需在早期施加少量引导步骤即可实现,涉及AI安全与对齐方向。

所属事件:新研究指推理模型安全恢复仅需几步引导(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →