论文:「深度幻觉」:Transformer 该更宽而非更深
xuanalogue · x · 2026-09-04
arXiv 论文《The Depth Delusion》提出架构条件化的 scaling law:最优深度按 DC^0.12 增长,最优宽度按 WC^0.34 增长,宽度应比深度快约 2.8 倍扩展。研究发现「临界深度」现象:超过 DcritW^0.44 后,继续加层即使参数增加也会推高 loss。实证覆盖 17M 到 7B 参数、30 种 Transformer 架构(R²=0.922);在 7B 规模上,64 层 6.38B 模型比 32 层 6.86B 模型差 0.12 nats。结论:更深不一定更好,最优深度-宽度权衡在生产规模依然成立。讨论中还提到深度扩展可能受梯度衰减导致的宽度瓶颈制约。
「研究」频道最新
- 巴黎 UniReps 研讨会开放征稿,聚焦跨模型表示统一,截稿 10 月 4 日 — ClementineDomi6 · 2026-09-04
- Utopia 开源双时态知识图谱,让 RAG 记住知识的演变 — Shruti_0810 · 2026-09-04
- 情绪不是理性顾问,而是思维搜索的元控制平面 — mimi10v3 · 2026-09-04
- f-loss 平衡频谱学习,像素级 Flow Matching 收敛提速 — serrjoa · 2026-09-04
- 被烂 ML 论文逼到读科学哲学:研究者推荐三篇必读 — _lewtun · 2026-09-04
- 「第二苦涩教训」:Sutton 之后,扩展该失败于应用层 — alexvoica · 2026-09-04