新报告提出按维度遗忘、跨深度检索和 16/896 MoE
Ahmad_Al_Dahle · x · 2026-07-21
一条回复在概述一份新技术报告里的三个设计点:
- KDA 不再用单一标量衰减,而是把 Gated DeltaNet 的遗忘机制改成按维度学习。
- AttnRes 不再对每一层残差一视同仁,而是跨深度选择性检索。
- LatentMoE 只激活 896 个专家中的 16 个,并用路由分数分位数来做更均衡的分配。
原帖的核心意思是:这些改动都在修正标准实现里常见的“一刀切”假设,比如线性注意力里的统一遗忘、每层残差等权、以及启发式专家均衡。
所属事件:Moonshot 发布 2.8T 开源模型 Kimi K3(14 条相关)→
「模型」频道最新
- Google 称搜索信息代理将于今夏登陆 AI Pro 和 Ultra — gaganghotra_ · 2026-07-22
- Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型 — ralucaadapopa · 2026-07-22
- Poolside 的 Laguna S 2.1 在 Nous Portal 免费开放两周 — NousResearch · 2026-07-22
- Qwen3.8 Max Preview 横评后被认为明显进步 — curiousily_ · 2026-07-22
- Moonshot 的 Kimi K3 登上 MathArena 第五名开源最佳 — xeophon · 2026-07-22
- Google 推出 Gemini 3.5 Flash Cyber,限量供政府和可信伙伴使用 — GoogleAI · 2026-07-22