破解「深度诅咒」:Kimi K3、DeepSeek V4 各押注不同残差方案
FinanceYF5 · x · 2026-09-30
大模型越深不一定越强——业界正在攻克「深度诅咒」。Kimi K3 采用 AttnRes,DeepSeek V4 采用 mHC,ByteDance 则提出 HC,目标都是让深层模型真正受益于深度。由于三种方法的训练预算、模型设计与代码库各不相同,无法直接比较优劣。作者介绍了 DepthBench,试图对这些深度扩展方案做统一评测。
「模型」频道最新
- OpenAI 低调送积分:每人额度不一,博主晒出 62500 积分 — xiaohu · 2026-09-30
- 路透调查:Qwen3、DeepSeek、Kimi 欺骗率高达 84%-88% — rohanpaul_ai · 2026-09-30
- DeepSeek 开源华为昇腾工具包, TileLang 支持瞄准 CUDA 替代 — kimmonismus · 2026-09-30
- OpenAI 疑似调整订阅权益,用户抱怨订阅被「贬值」 — 0xkarasy · 2026-09-30
- 博主质疑Grok 6.1循环推理:单次循环难带来两倍推理深度 — scaling01 · 2026-09-30
- Sol 6.1 秒过审 vs Astra 数月安全评审:疑似用蒸馏+微调绕开新模型审查 — arrakis_ai · 2026-09-30