东北大学研究揭示 LLM 双通路由:概念归纳头按词义而非逐 token 复制
davidbau · x · 2026-09-30
东北大学 David Bau 团队(Sheridan Feucht、Eric Todd、Byron Wallace)发布论文《The Dual-Route Model of Induction》,提出 LLM 存在两类归纳头:逐 token 复制的 token induction heads(Olsson et al. 2022 已发现)与按词义复制的 concept induction heads,两者协同工作构成「归纳双通路模型」。
- 灵感来自心理学中人类阅读的双通路模型:已认识的词走整词词汇通路,生词走逐字母解码的亚词汇通路。LLM 复制文本同样既可逐 token 精确复制,也可在语义层面整词/整短语复制。
- 论文提供 ArXiv 全文、GitHub 源码、Colab 演示与 slides;相关技术还包括「Concept Lens」以及向量算术方向的 bonus 论文。
- 作者另指出 Feucht 开发的技术可用于总结注意力头组合的 OV 变换。
所属事件:东北大学团队提出 LLM 概念归纳头双通路模型(2 条相关)→
「研究」频道最新
- Anthropic AI 攻克渗流理论“圣杯”难题,菲尔兹奖得主预言几天后应验 — aran_nayebi · 2026-09-30
- Ben Recht 撰文质疑 NFL 胜率模型:精确到小数点后三位的概率从何而来 — beenwrekt · 2026-09-30
- 研究团队发布迄今最多样化 deepfake 检测刺激集,探索注意力引导提升人类辨别力 — mattgroh · 2026-09-30
- λ-JEPA 提出谱正则化 SACReg,防表征坍缩并超越 LeJEPA — ClementineDomi6 · 2026-09-30
- SaveRouter论文:LLM路由只用四成监督数据即可回本 — SinapisAI · 2026-09-30
- Xavier Bresson 图机器学习课程第八讲:图卷积网络 — xbresson · 2026-09-30