EMNLP 2026: RECAP 利用错误推理提升模型安全性

PoloChau · x · 2026-08-23

论文《RECAP》被 EMNLP 2026 接收。研究发现注入少量错误推理会使模型安全性下降 36%。RECAP 是一种 RL 后训练方法,不增加额外成本,教导推理模型识别、覆盖并从不安全推理路径中恢复,从而在保持推理能力的同时,增强越狱抵抗能力并降低过度拒绝。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →