COLM 2026 论文:拆解多语言模型安全降级原因

davlanade · x · 2026-08-17

COLM 2026 接收论文《Why Do Safety Guardrails Degrade Across Languages?》指出,大模型在非英语语言中存在安全降级问题。传统评估仅依赖越狱成功率(JSR),混淆了多种因素。研究使用多群组项目反应理论(IRT)模型,基于 61 种模型配置、10 种语言和 190 万条响应,解耦了模型的内在安全能力、提示词固有难度、全局语言处理难度以及特定提示词的跨语言安全缺口。研究发现安全能力主要是一维的,且存在“英语反转”现象。

所属事件:IRT 拆解跨语言安全退化:22 组配置英语反更易失守(5 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →