Paper Decodes LLM Cross-Lingual Safety Degradation; English Sometimes Fails Hardest
A COLM2026-accepted paper applies Multi-Group IRT to decompose cross-lingual safety scores into four dimensions across 61 model configurations and 10 languages, finding safety is largely one-dimensional. Surprisingly, in 22 configurations English safety was worse than low-resource languages, a signal masked by aggregate scores.
2026-08-17 ~ 2026-08-17 · 4 related posts
- Paper: LLM Safety Guardrails Degrade Differently Across Languages — zeeshanp_ · 2026-08-17
- Multi-group IRT decomposes cross-lingual safety benchmarks — sanmikoyejo · 2026-08-17
- Study: English more vulnerable than low-resource languages in 22 model configs — sanmikoyejo · 2026-08-17
- Paper: Why Safety Guardrails Degrade Across Languages — sanmikoyejo · 2026-08-17