Anthropic 机械可解释性团队发现:Scaling Law 拐点源于归纳头涌现
gordic_aleksa · x · 2026-09-14
gordicaleksa 回顾了 Anthropic 机械可解释性团队的一项发现:Kaplan et al. scaling law 曲线上的那个凸起,实际由 induction heads(归纳头)的涌现造成。
- 归纳头是一种注意力头,行为类似「[A][B] … [A] → [B]」:遇到 token A 时,在上下文中找到之前出现的 A,并复制其后继 token B
- 当 A、B 的含义越抽象,就越远离简单的字面复制,越接近 in-context learning
- 关键结论:单层 transformer 不会形成归纳头,因此不经历这个相变,loss 曲线更平缓;2 层以上才会涌现归纳头
所属事件:Anthropic 发现 Scaling Law 拐点源于归纳头涌现(2 条相关)→
「研究」频道最新
- Stanford/MIT 研究:同一模型换 harness 跑分可差 6 倍 — burkov · 2026-09-15
- 数学家临近重大突破却被 AI 抢发,开源科学模式遭拷问 — ScottNover · 2026-09-15
- ECCV 论文 ART 攻克复杂妆容迁移,发布首个 2K 真实妆容数据集 — jiqizhixin · 2026-09-15
- 数学家为何抵触 AI 证题?不止护饭碗,还有更深一层的道理 — rbhar90 · 2026-09-15
- CCN2026 辩论录像:NeuroAI 能否成为理解大脑与心智的必经之路 — aran_nayebi · 2026-09-15
- 仅 5 小时数据全盒训练,让机器人抓取光照盒也能泛化 — DominiqueCAPaul · 2026-09-15