论文解析 LLM 跨语言安全护栏退化 英语竟更易失效
COLM2026 新论文用多群组 IRT 把跨语言安全总分拆解为语言无关安全鲁棒性、提示词内在难度、全局语言处理难度与提示词特定跨语言差距四个维度;对 10 种语言、61 个模型配置的分析显示安全能力主要呈单一维度,但 22 个配置中英语安全性反而低于低资源语言,总分掩盖了诊断信号。
2026-08-17 ~ 2026-08-17 · 4 条相关
- LLM 跨语言安全护栏退化原因:模型反而更易在英语失效 — zeeshanp_ · 2026-08-17
- Multi-group IRT 分解跨语言安全评测基准 — sanmikoyejo · 2026-08-17
- 研究:22种模型配置下英语安全性比低资源语言更差 — sanmikoyejo · 2026-08-17
- 新论文解析安全护栏跨语言降解原因:总分掩盖诊断 — sanmikoyejo · 2026-08-17