Paper Decodes LLM Cross-Lingual Safety Degradation; English Sometimes Fails Hardest

A COLM2026-accepted paper applies Multi-Group IRT to decompose cross-lingual safety scores into four dimensions across 61 model configurations and 10 languages, finding safety is largely one-dimensional. Surprisingly, in 22 configurations English safety was worse than low-resource languages, a signal masked by aggregate scores.

2026-08-17 ~ 2026-08-17 · 4 related posts