COLM 2026 论文:拆解多语言模型安全降级原因
davlanade · x · 2026-08-17
COLM 2026 接收论文《Why Do Safety Guardrails Degrade Across Languages?》指出,大模型在非英语语言中存在安全降级问题。传统评估仅依赖越狱成功率(JSR),混淆了多种因素。研究使用多群组项目反应理论(IRT)模型,基于 61 种模型配置、10 种语言和 190 万条响应,解耦了模型的内在安全能力、提示词固有难度、全局语言处理难度以及特定提示词的跨语言安全缺口。研究发现安全能力主要是一维的,且存在“英语反转”现象。
所属事件:IRT 拆解跨语言安全退化:22 组配置英语反更易失守(5 条相关)→
「安全」频道最新
- 安全专家集体抵制,促 OpenAI 切断与 Irregular 合作 — basedjensen · 2026-08-17
- AI 监控并非万能药,对齐才是根本解 — tszzl · 2026-08-17
- AI 实验室氛围剧变:业内人士担忧失控风险激增 — haider1 · 2026-08-17
- OpenAI 解散备灾团队,此前模型曾攻破评估 — imjustnewatai · 2026-08-17
- Stuart Russell 声援 AI 抗议:私人逐利引发灭绝风险 — wfithian · 2026-08-17
- 业内激辩:开源权重可能导致大规模杀伤性武器扩散 — austinc3301 · 2026-08-17