Most recurring multilingual SAE features fail causal validation — only one truly drives translation in Gemma

ravithejads · x · 2026-09-08

A BlackboxNLP 2026 Special Track paper causally validates multilingual sparse autoencoder (SAE) translation features in Gemma 2 and Gemma 3:

A methodological warning for interpretability researchers: activation frequency alone is unreliable; causal validation is a must.

Original post →

More from Research

Research channel →