COLM 三篇论文齐质疑:Transformer 标配设计在暗处付出实价
量子位 · wechat · 2026-08-17
量子位报道,COLM 2026 上多篇论文同时把矛头对准 Transformer 里少有人质疑的「标配」设计,结论出奇一致:每处默认选择都在某个评测测不到的维度上付出代价。
长上下文的裂缝:Ai2 等机构的《Cracks in the Foundation》用 Llama2/3、Qwen3、Olmo3 的架构取值排列组合训练了 26 个 7-8B 模型(OlmPool,烧掉超 17 万 GPU 小时)。HELMET 32K 上最高与最低差 26.5 分(相对 47%);单项开关影响不大,但 GQA 与滑动窗口注意力叠加平均掉 9 分,比单项加总更狠。去掉 Olmo3 的 QK 归一化反而涨 6 分,但在 Llama3 上掉 3.8 分——同一标配换底子结果相反。此外,「注意力汇聚」越明显长上下文反而越好,与直觉相反。
被吃掉的梯度:康奈尔大学《Lost in Backpropagation》指出输出投影层在反向传播中成为信息瓶颈:误差信号理论信息量与词表同大,但受隐藏维度限制,GPT-2、Pythia、Llama3、OLMo2、Qwen3 上 95%-99% 的梯度范数在此被削掉,剩余信号与原始梯度余弦相似度仅 0.1-0.2。
剪层断推理链:图宾根大学《When Fewer Layers Break More Chains》发现层剪枝对知识类测评影响平缓,但 s1.1-7B 在 AIME24 上仅剪一层正确率大幅下滑,剪两层接近零,测试时扩展失效,且 LoRA 与全参数微调都难以救回。三篇论文共同指向:主流模型广泛采用的常规设计正在被重新审视。
所属事件:研究称 Transformer 标配架构选择拖累长上下文能力(3 条相关)→
「模型」频道最新
- Qwen 3.8 与 DeepSeek 4 本地实测:质量显著跃升 — olcan · 2026-08-17
- Sarvam AI 发布 105B 语音模型与全栈 Agent 方案 — AashaySachdeva · 2026-08-17
- 实测 GPT-4o Pro 连续运行突破 2 小时 — banteg · 2026-08-17
- 本地实测:Qwen 3.8 27B 靠「过度思考」逼近 Sonnet 水平 — maxwell321 · 2026-08-17
- 解锁 ChatGPT 百万上下文需注意:超 272K 令牌价格翻倍 — eyishazyer · 2026-08-17
- H3 模型训练困难,社区呼吁发布基座版 — crinklypaper · 2026-08-17