关闭单个注意力头竟改善 Qwen3-1.7B 的「自省」行为

Sauers_ · x · 2026-10-09

Sauers 的一篇机制可解释性线程:Qwen3-1.7B 中有单个注意力头负责一种类似 sandbagging 的自省行为,关掉这个头反而能改善模型的自省表现。

背景是被引的「隐藏动物」实验:让模型想一个动物但不在回复中说出,再在 CoT 中强制填入随机动物(避免偏好偏差),并从 CoT 中删除 KV 缓存但保留在回复中。结果发现:

机制上,一个注意力头承担了这种「隐藏又拒绝回答」的行为,是模型内省与自我知识利用的少见实证发现。

所属事件:研究称LLM可自省找回已删CoT信息,瓶颈在引导而非存储(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →