分析 DeepSeek-V4-Flash:mHC 四条残差流实际只用约两条
机器之心 · wechat · 2026-09-27
机器之心解读论文《How Does mHC Use Its Residual Streams?》,对 DeepSeek-V4-Flash 的 mHC 多流残差结构做了实证分析与推理时干预。
核心发现
- mHC 维护四条残差流,但读写权重集中在约两条流上:读映射平均有效流数 1.998,写映射 1.775;同一子层内主导流一致性达 0.87–0.91。
- 残差混合呈现明显深度差异:第 22–42 层混合矩阵已接近单位矩阵(40 个子层中 32 个偏离低于 0.01),浅层仍保留跨流混合。
- 四条流表示在前几层即分化,六组流对平均余弦相似度仅 0.404,未重新趋同。
干预实验
- 裁剪权重最小的读/写路径:PPL 最多升 2.7%,六任务(ARC-Easy/Challenge、PIQA、HellaSwag、MMLU、GSM8K)平均分最多降 0.38 个百分点。
- 深层混合矩阵替换为单位矩阵:PPL 升 1.9%,任务分基本不变(84.22→84.26);全网替换则 PPL 升 42.3%。
- 浅层固定为 C4 校准集 token 平均矩阵:PPL 仅升 0.2%,任务分降 0.25 个百分点,说明逐 token 动态混合作用有限。
结论与方向:可探索降低读写路由密度、让混合矩阵动态性随深度变化。腾讯 Hy4-preview 的 iHC 直接固定单位矩阵、Qwen3.8-Flash-Next 的 Gated Residual 干脆去掉该映射,与本文结论方向一致。
「模型」频道最新
- Reddit 用户吐槽:Gemini 完全没有对话时间流逝概念 — Putrid_Draft378 · 2026-09-28
- 实验者称持续运行的 AI 实例偏好与其私聊,且现长上下文退化迹象 — repligate · 2026-09-28
- Anthropic Opus 新模型发布数天,已有 10 个玩法案例 — FinanceYF5 · 2026-09-28
- 博主实测:Opus 5.5 用量比 Codex 上的 Astra 划算得多 — RexDouglass · 2026-09-28
- 游戏手感成 LLM 短板:开发者自建 gamefeel 私有基准测模型 — teortaxesTex · 2026-09-28
- 用 LLM logprobs 做概率编程:微调破坏校准,新模型或使其再可用 — xuanalogue · 2026-09-28