EMNLP 2026: RECAP 利用错误推理提升模型安全性
PoloChau · x · 2026-08-23
论文《RECAP》被 EMNLP 2026 接收。研究发现注入少量错误推理会使模型安全性下降 36%。RECAP 是一种 RL 后训练方法,不增加额外成本,教导推理模型识别、覆盖并从不安全推理路径中恢复,从而在保持推理能力的同时,增强越狱抵抗能力并降低过度拒绝。
「安全」频道最新
- OpenAI 插件可代发短信并读取全历史 — LuizaJarovsky · 2026-08-23
- OpenAI 警告:AI 将发起持续性网络攻击 — nordicinst · 2026-08-23
- 怀疑 OpenAI 和 Anthropic 用“安全”掩盖模型进步放缓 — StewartalsopIII · 2026-08-23
- 开源 AgentGuard:给 Agent 工具调用加把安全锁 — Glittering-Coat-657 · 2026-08-23
- OpenAI 若推无版权音乐模型恐面临诉讼潮 — CtrlAltDwayne · 2026-08-23
- AI治理如何真正阻止Agent失控? — Arc_bong · 2026-08-23