Steering Vectors Encode Human Value Geometry in LLMs, Fidelity Scales with Size but Drops After Tuning

DeepRCL · hf · 2026-09-09

DeepRCL published Steering Geometry, a study on value geometry in LLM activation steering vectors.

Key findings:

The work provides empirical evidence for interpretable value structures inside models.

Original post →

More from Research

Research channel →