新论文提出 DepthBench:残差连接设计决定模型有效计算深度上限
teortaxesTex · x · 2026-09-30
Shiwei Liu 团队发布新论文,提出「扩展有效计算深度」这一新的 scaling 维度,并推出 DepthBench 基准,对 AttnRes、mHC、KEEL、LNS、MoDA 等 10 种残差连接设计做公平对比。
实验设计:固定模型规模、数据和训练配方,只改变宽深比,从「浅而宽」扫到「深而窄」。核心发现:
- Pre-LN 及其大多数变体存在天花板:把更多容量移向深度后,收益先变平再反转,其最优宽深比停留在 42.7–76.0 的相对大宽深比区间。
- 在实验性 400M 模型上,mHC 在 24 层就饱和;但在 DSV4.1-Flash 这类极宽极浅模型的目标场景中,mHC 至少不逊于 AttnRes。
作者希望看到各实验室的内部消融结果来进一步验证。
所属事件:DepthBench:残差连接设计决定模型有效计算深度上限(2 条相关)→
「模型」频道最新
- Sentdex 力挺 GLM 5.3:在家跑前沿模型,别再为说教你的人付钱 — Sentdex · 2026-09-30
- 研究发现 LLM 思维链中的情绪化表达可能是功能性的 — xuanalogue · 2026-09-30
- CoT 显示「诚实反馈」时,你就该担心了 — TheZvi · 2026-09-30
- 博主称 Anthropic 给 Claude 用户送上惊喜更新 — eyishazyer · 2026-09-30
- GPT 6.1 Sol 发布缓存降价 50%,Anthropic 却因安全扣住 Sonnet 5.5 — oran_ge · 2026-09-30
- OpenRouter 数据简报:token 用量爆发,开源模型支出半年涨 10 倍 — AccBalanced · 2026-09-30