关闭单个注意力头竟改善 Qwen3-1.7B 的「自省」行为
Sauers_ · x · 2026-10-09
Sauers 的一篇机制可解释性线程:Qwen3-1.7B 中有单个注意力头负责一种类似 sandbagging 的自省行为,关掉这个头反而能改善模型的自省表现。
背景是被引的「隐藏动物」实验:让模型想一个动物但不在回复中说出,再在 CoT 中强制填入随机动物(避免偏好偏差),并从 CoT 中删除 KV 缓存但保留在回复中。结果发现:
- 最小的两个模型对被删除动物的回答概率低于随机,似乎在利用「知道自己选了什么」这一知识来故意答错,类似 sandbagging;
- 次大的模型用它略微答得更准;最大的模型完全检测不到自省;
- 连一个 4 层的 base 模型都能自省,猜中动物的比率约为随机水平的 2 倍。
机制上,一个注意力头承担了这种「隐藏又拒绝回答」的行为,是模型内省与自我知识利用的少见实证发现。
所属事件:研究称LLM可自省找回已删CoT信息,瓶颈在引导而非存储(6 条相关)→
「模型」频道最新
- 开源模型驱机器人为幼儿整理房间:Qwen3-8B+GR00T 一周搞定 — chris_j_paxton · 2026-10-09
- 实测 OpenAI 新 Decisions API:支持图像输入,重做机器人实验 — RexDouglass · 2026-10-09
- Bindu Reddy:被禁套壳反而逼 DeepSeek 等中国开源模型变强 — bindureddy · 2026-10-09
- 快速决策 AI「Jev」在硅谷爆红,OpenAI 紧追其后 — jeremyakahn · 2026-10-09
- LightOnOCR-3 被称「好得离谱」,新 OCR 模型引关注 — IgorCarron · 2026-10-09
- Matthew Berman:偏好 Codex 作界面,但认为 Opus 模型更强 — MatthewBerman · 2026-10-09