机制研究揭示:大模型能力“涌现”源于稀疏注意力路由

andrewgwils · x · 2026-08-04

推文转述了一项最新的大模型机制可解释性研究,揭示了 LLM 所谓的“涌现”能力并非单纯由模型规模扩大带来的魔法产物,也不是评测指标造成的错觉。

研究指出,这种突然获得的能力实际上是模型在训练过程中,通过高方差的优化搜索找到了稀疏的注意力路由电路所导致的。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →