拆解安全回复结构:只训理由部分可减少模型误拒且不失安全

POSTECH · hf · 2026-09-08

POSTECH 研究将安全微调的回复分解为「拒答声明」和「理由说明」两部分,发现仅在理由部分上训练即可显著减少模型的错误拒答(false refusals),同时保持安全性不降。这一结构性分析为缓解过度对齐导致的「拒答一切」问题提供了新思路。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →