拆解安全回复结构:只训理由部分可减少模型误拒且不失安全
POSTECH · hf · 2026-09-08
POSTECH 研究将安全微调的回复分解为「拒答声明」和「理由说明」两部分,发现仅在理由部分上训练即可显著减少模型的错误拒答(false refusals),同时保持安全性不降。这一结构性分析为缓解过度对齐导致的「拒答一切」问题提供了新思路。
「研究」频道最新
- 研究者吐槽:大量生物 ML 模型仅比朴素线性基线好不到 10% — iskander · 2026-09-08
- Sander Dieleman 访谈:扩散模型的演化与生成 AI 背后的概率直觉 — sedielem · 2026-09-08
- 从语言模型到世界行动系统:agent 综述提出按授权程度分配智能体权限框架 — dair_ai · 2026-09-08
- 评测空间「有效秩」太低,研究者呼吁用连续基准提稳健性 — ajratner · 2026-09-08
- LlamaIndex CEO:对抗刷榜不是弃用基准,而是要更多更稳的基准 — ajratner · 2026-09-08
- UNC 博士后 ECCV 2026 中 5 篇论文,覆盖世界生成与视频推理 — mohitban47 · 2026-09-08