预归一化架构的表示崩塌与修复
SeunghyunSEO7 · x · 2026-07-10
回复中提到,MAI 观察到类似问题,并通过将 attention 模块的输出投影初始化为 0.0 来缓解,使得先由 MLP 学习,表示再逐步演化。 前文还提到 pre-norm 架构中的 representation collapse 可能损害 MoE 的负载均衡,相关改进思路包括 depth scaling 和 muon。
所属事件:研究揭示Pre-norm架构或破坏MoE负载均衡(2 条相关)→
「研究」频道最新
- DiFA 让扩散模型推理对齐前向统计,生成质量更高 — cn-scut · 2026-07-21
- 微软研究院把 LLM Judge 变 Coach,优于 rubric RL — MicrosoftResearch · 2026-07-21
- OpenLongTail 用生成视角补齐长尾自动驾驶数据 — TexasAMUniversity · 2026-07-21
- GEPO 用组熵改造 GRPO,在 13 项基准上更稳更强 — internlm · 2026-07-21
- 阿里 RynnBrain 1.1 把具身基础模型扩到 122B-A10B — Alibaba-DAMO-Academy · 2026-07-21
- Apple 提出无需真实环境的 API 智能体合成数据方法 — _akhaliq · 2026-07-21