IOI 电路在更大模型中失效:26 个注意力头结论难迁移
ChenhaoTan · x · 2026-10-09
ChenhaoTan 在可解释性研究回顾线程中介绍了对 IOI(间接宾语识别)电路研究的扩展验证。
- 原始研究:Wang 等人发现 GPT-2 small 在补全 "When Mary and John went to the store, John gave a drink to Mary" 这类句子时,由 26 个注意力头组成的电路负责追踪重复人名并帮助选择另一人作为接受者。
- 新扩展发现:这一电路在更大的 GPT-2 模型中对行为的解释力下降,且在其他模型中可能并不存在;负责复制正确名字的头仍然重要,但其余计算分散到更多的头上。
- 这意味着在小模型上归纳的可解释性结论未必能外推到大模型,跨模型泛化需谨慎。
所属事件:可解释性研究在更大模型上复现结果分化(2 条相关)→
「研究」频道最新
- 亚琛工大开源 ARROW:任意 RGB 输入统一 3D 重建与点跟踪,刷新 SOTA — kwangmoo_yi · 2026-10-09
- HAIPS 2026 明日在 COLM 举行,隐私安全学者云集 — tianshi_li · 2026-10-09
- 用广义均值收紧贝叶斯误差的 Bhattacharyya 与 Chernoff 上界 — FrnkNlsn · 2026-10-09
- PAMI 框架:部件锚定让文生人物交互动作接触精度提升 14.5% — _akhaliq · 2026-10-09
- 研究揭示 LLM 当「新颖性评审」极不稳定,判定结果随设计选择剧烈波动 — _akhaliq · 2026-10-09
- 谷歌 AMIE 登上《柳叶刀》:真实门诊诊断与医生一致率达 90% — sundarpichai · 2026-10-09