Paper: Why Safety Guardrails Degrade Across Languages

sanmikoyejo · x · 2026-08-17

This paper investigates why LLM safety degrades in non-English languages. It introduces a Multi-Group IRT framework to decompose aggregate scores into language-agnostic robustness, intrinsic hardness, processing difficulty, and cross-lingual safety gaps.

Key Findings:

Related event: Paper Decodes LLM Cross-Lingual Safety Degradation; English Sometimes Fails Hardest(4 posts)→

Original post →

More from Safety

Safety channel →