LLM 跨语言安全护栏退化原因:模型反而更易在英语失效

zeeshanp_ · x · 2026-08-17

论文《Why Do Safety Guardrails Degrade Across Languages?》被 COLM2026 接收。研究指出大模型在非英语语言中存在安全退化现象。

核心发现:

方法:提出多群组项目反应理论(IRT)框架,解耦了模型通用安全能力、提示词内在难度、语言处理难度等因子,基于 1.9M 响应数据进行分析。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →