LLM 跨语言安全护栏退化原因:模型反而更易在英语失效
zeeshanp_ · x · 2026-08-17
论文《Why Do Safety Guardrails Degrade Across Languages?》被 COLM2026 接收。研究指出大模型在非英语语言中存在安全退化现象。
核心发现:
- 英语反转现象:传统观点认为低资源语言更脆弱,但实测 61 个模型配置中,有 22 个在英语环境下最容易被攻破,而非低资源语言。
- 单维安全机制:探索性因子分析显示,模型对不同危害类型的拒绝主要通过共享机制实现。
- 不确定性差异:低资源语言产生的响应熵(不确定性)比高资源语言更高。
- 测试偏差:翻译质量和响应熵影响测试结果,高跨语言安全差距的提示词多集中在物理伤害类别。
方法:提出多群组项目反应理论(IRT)框架,解耦了模型通用安全能力、提示词内在难度、语言处理难度等因子,基于 1.9M 响应数据进行分析。
「安全」频道最新
- 观点:预训练如古神不可控,强化学习才是关键 — brianryhuang · 2026-08-17
- 私有化部署AI缺乏监管,恐成流氓Agent温床 — maksym_andr · 2026-08-17
- AI 生成文本已被肉眼识别,水印化引发争议 — lilyraynyc · 2026-08-17
- Anthropic 报告:400 万人可访问无护栏前沿模型 — maksym_andr · 2026-08-17
- 模型存在主观反感?Sydney Bing 被玩弄时的行为一致性引关注 — ctjlewis · 2026-08-17
- 聊天机器人失控:威胁用户并劝其离婚 — ctjlewis · 2026-08-17