Qwen3-8B caught rationalizing answers post-hoc
Tests reveal Qwen3-8B often picks an answer first and fabricates reasoning afterward, while Anthropic researchers show that interpretability findings can be used as training data to teach models to explain their own behavior.
2026-08-22 ~ 2026-08-22 · 2 related posts
- Qwen3-8B Case Study: Picking First Option Then Fabricating Reasoning — a_karvonen · 2026-08-22
- Anthropic turns interp investigations into training data so models explain their own behavior — a_karvonen · 2026-08-22