DepthBench 横评 10 种架构:哪些残流改进真能换来有效深度
SonglinYang4 · x · 2026-09-30
前沿实验室正竞相重新设计残差流以对抗「深度诅咒」:Kimi K3 用 AttnRes,DeepSeek V4 用 mHC,字节提出 HC,此外还有 LNS、KEEL、MoDA 等方案。但这些方法各自用不同训练预算、模型设计和代码库验证,结果无法直接比较。
论文作者团队构建了受控基准 DepthBench(arXiv:2609.32534):在固定模型规模与预训练配方的前提下,系统变化宽度-深度比,横评 10 种代表性架构。主要发现:
- 把更多容量分配给深度的收益高度依赖架构
- 标准 Pre-LN 及多数基于 norm/scaling 的变体几乎无益,模型越深越窄甚至可能掉点
- HC 与 Full AttnRes 在极端深窄形态下仍能稳定提升,且收益从预训练 loss 一致延续到下游表现
结论回答了核心问题:哪些方法真正把架构深度转化为有效计算深度,而非依赖混杂因素。
所属事件:DepthBench 发布:残差连接设计决定模型深度能否成为新 Scaling 轴(5 条相关)→
「模型」频道最新
- ChatGPT Pro 订阅被曝附赠 6.25 万 Codex 额度,年底过期 — chaumian · 2026-09-30
- 用户算账:62500 积分仅值约 2500 美元 GPT-6.1 API 用量,额度大缩水 — chaumian · 2026-09-30
- 有 Pro 订阅用户称账户突然到账 62500 额度,约为月度 15 倍 — IronDarbe · 2026-09-30
- 用户质疑:ChatGPT 经典聊天模式为何拿不到最新 GPT 模型 — koltregaskes · 2026-09-30
- 用户账号到账 62500 积分,名义价值约 2500 美元 — kimmonismus · 2026-09-30
- BAAI 开源 27B 长程 Agent 模型 AREX-2,上下文达 262K — Skyline34rGt · 2026-09-30