边界感知自蒸馏方法:精准控制 LLM 拒答边界,减少过度拒答
MultiverseComputingCAI · hf · 2026-09-08
Multiverse Computing 在 Hugging Face 发布论文《Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal》。方法核心:用模型自生成的拒答数据与 boundary-pair 训练做窄边界安全对齐,精准控制拒答边界,在对目标内容提升拒绝能力的同时,降低过度拒答和有害输出。属于安全对齐方向的实用新方法。
「研究」频道最新
- 瞬态混沌或是解难题训练的必然代价:推理成本不可预测 — wgilpin0 · 2026-09-09
- 新研究:推理变慢源于瞬态混沌,分形盆地困住模型潜在推理 — wgilpin0 · 2026-09-09
- 鞍点散射让推理模型尝试更多解:Lyapunov 指标可量化 — wgilpin0 · 2026-09-09
- 训练中途分岔实验:学会泛化的同时分形盆地出现 — wgilpin0 · 2026-09-09
- 研究揭示推理模型「过度思考」:相似提示推理长度差达10倍 — wgilpin0 · 2026-09-09
- 推理卡壳的动力学解释:错误解在隐空间形成鞍点 — wgilpin0 · 2026-09-09