LatentMoE 稀疏化与扩展效率讨论
ivan_bezdomny · x · 2026-07-17
转推的核心是在讨论 LatentMoE 这类稀疏化设计:
- 作者表示自己长期主张激活比例可以低于 2%,甚至有理由继续在 1% 以下 维持扩展。
- 被引用内容提到:LatentMoE 只有 16/896 个专家被激活,配合 Kimi Delta Attention 和 AttnRes,据称能带来 2.5x 更高效的扩展。
- 还顺带提到,类似“OpenAI / Anthropic 也在显著更稀疏化”的传闻与这一路线相互呼应。
- 转推者补充了一个成本对比:K3 大约在单位 token 成本上接近 V4,但更大、成本却高出 17 倍,并借此质疑相关利润率。
「模型」频道最新
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- Terminal Bench v4 榜单:GLM-5.3 以 41.9% 一骑绝尘 — Ok_Warning2146 · 2026-09-11