Peter Gostev 辨析模型稀疏度爆料:Kimi 26:1、DeepSeek 32:1,1.2T 激活参数不可信
inductionheads · x · 2026-09-07
Peter Gostev 针对「OpenAI 某模型有 1.2T 激活参数」的网传爆料提出质疑。他算了一笔 MoE 稀疏度账:Kimi k3 总参数 2.8T、激活 104B,稀疏比约 26:1;DeepSeek v4 更稀疏,1.4T 总参数对应 49B 激活,约 32:1。他反问:OpenAI 没理由突然把稀疏比降到 5:1 或 10:1,按行业趋势只会更稀疏,因此「1.2T 激活」的说法根本编不圆,爆料可信度很低。
「模型」频道最新
- 传 30 万块 GB200 训练下一代模型,总算力或达预训练 5 倍 — scaling01 · 2026-09-07
- 爆料人推测 GPT-6 或用 2-5 倍预训练算力做 RL — scaling01 · 2026-09-07
- 违反明令的 triton 是作弊,没禁的 PyPI 是任务 bug — xeophon · 2026-09-07
- 前沿预训练或不再超 2 个月:拖 100 天等于浪费算法进步 — scaling01 · 2026-09-07
- 实测用 Codex 复刻游戏:40分钟还原七七八八,零 Blender 基础 — FuSheng_0306 · 2026-09-07
- Conitzer指出GPT-6 Astra仍做不到的事,质疑AGI标签滥用 — conitzer · 2026-09-07