Multi-group IRT decomposes cross-lingual safety benchmarks

sanmikoyejo · x · 2026-08-17

Multi-group IRT separates aggregate safety scores into four components: language-agnostic robustness, intrinsic prompt hardness, global language difficulty, and cross-lingual safety gaps, evaluated on MultiJail across 61 models and 10 languages.

Related event: Paper Decodes LLM Cross-Lingual Safety Degradation; English Sometimes Fails Hardest(4 posts)→

Original post →

More from Research

Research channel →