Langford 探讨 Transformer 信息丢弃与架构设计启示

ML 理论学者 John Langford 在推串中分析梯度下降对 Transformer 架构的隐含约束:传统 Transformer 前几层负责 token 语义解析,之后丢弃信息,导致末层难以保留相关信息。相比之下,Full Bandwidth Transformer 的初始层可承担深层计算,末层仍能保留信息,对深度利用更优。另有观点指出,丢弃瞬态计算状态或可避免循环状态漂移,成为一种自我修正机制。

2026-09-06 ~ 2026-09-06 · 3 条相关