直接改权重:Goodfire VPD 让模型答对率提升 10 倍,并揭开自省失效机制
Sauers_ · x · 2026-10-09
Sauers 展示用 Goodfire 的 VPD(adVersarial Parameter Decomposition)子组件直接编辑模型权重,仅 16 次子组件编辑就让模型答对动物问题的概率提升 10 倍(随机概率仅 2%,共 50 种动物)。
为解释这一奇怪的「自省」行为,作者让 Opus 5.5 做了多组手动实验,得出的机制模型包括:
- 模型内存在两个竞争的注意力头:一个把此前存储在句号 token 里的动物名复制到输出,另一个则试图抑制它;自省类 prompt 会激活抑制通路,导致答对率下降。
- 「抑制」效应并非由文档内容特异引起:与 LLM 无关的 CPU 原理文档(长度与风格仿 Janus 的文章)也能触发同样效果,背后是同一个「抑制自省」注意力头。
- 给模型看 Janus 的 LLM 解释文有时能提高准确率、甚至逆转 1.7B 模型的「sandbagging」式行为,但有时反而降低;部分是 prompt 措辞效应——用 introspection/recall 等词直接提问即可消除 1.7B 的自省抑制。
- 单个注意力头就是 Qwen3-1.7B 这种自省「假性放水」行为的元凶,关掉它即可改善自省表现。
「模型」频道最新
- 开源权重≠开源:开发者主张改用 open-weight 措辞 — kipperrii · 2026-10-09
- ChatGPT 编造判例致律师被停职,视频复盘 AI 幻觉司法翻车 — dadakoglu · 2026-10-09
- 用户实测:Qwen3.8 跑 Hermes 自主配置电脑备考 CPA,数月拖延一次搞定 — natesiggard · 2026-10-09
- 用户实测:GPT-6 网页研究比 5.6 快约 10 倍 — flowersslop · 2026-10-09
- FineWeb 作者:用 27B 模型标注预训练数据很疯狂,但通用模型更省部署 — antoine_chaffin · 2026-10-09
- Hugging Face 作者谈小模型:大规模任务要吞吐量,微调小模型仍是王道 — antoine_chaffin · 2026-10-09