COLM 三篇论文齐质疑:Transformer 标配设计在暗处付出实价

量子位 · wechat · 2026-08-17

量子位报道,COLM 2026 上多篇论文同时把矛头对准 Transformer 里少有人质疑的「标配」设计,结论出奇一致:每处默认选择都在某个评测测不到的维度上付出代价。

长上下文的裂缝:Ai2 等机构的《Cracks in the Foundation》用 Llama2/3、Qwen3、Olmo3 的架构取值排列组合训练了 26 个 7-8B 模型(OlmPool,烧掉超 17 万 GPU 小时)。HELMET 32K 上最高与最低差 26.5 分(相对 47%);单项开关影响不大,但 GQA 与滑动窗口注意力叠加平均掉 9 分,比单项加总更狠。去掉 Olmo3 的 QK 归一化反而涨 6 分,但在 Llama3 上掉 3.8 分——同一标配换底子结果相反。此外,「注意力汇聚」越明显长上下文反而越好,与直觉相反。

被吃掉的梯度:康奈尔大学《Lost in Backpropagation》指出输出投影层在反向传播中成为信息瓶颈:误差信号理论信息量与词表同大,但受隐藏维度限制,GPT-2、Pythia、Llama3、OLMo2、Qwen3 上 95%-99% 的梯度范数在此被削掉,剩余信号与原始梯度余弦相似度仅 0.1-0.2。

剪层断推理链:图宾根大学《When Fewer Layers Break More Chains》发现层剪枝对知识类测评影响平缓,但 s1.1-7B 在 AIME24 上仅剪一层正确率大幅下滑,剪两层接近零,测试时扩展失效,且 LoRA 与全参数微调都难以救回。三篇论文共同指向:主流模型广泛采用的常规设计正在被重新审视。

所属事件:研究称 Transformer 标配架构选择拖累长上下文能力(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →