推算 DeepSeek V4 与 Kimi K3 等模型真实参数规模
teortaxesTex · x · 2026-08-05
技术博主通过对比激活与总参数量的启发式公式(取平方根),推算出各前沿模型的等效参数量:V4-Flash 约 60B,GLM 约 172B,V4-Pro 约 280B,Kimi K3 约 540B。
作者指出,若按以往独立强化学习(RL)项目的规律,升级后的 V4-Pro 性能可能超越 K3;但考虑到 V4-Pro 的大部分性能提升已被压缩进 V4-Flash 版本,因此其实际能力上限需重新评估。
「模型」频道最新
- 传阿里 Qwen3.8-Max 曝光:2.4T 参数与百万上下文 — Aiden_Tech_Ai · 2026-08-05
- 开发者意外改动Gemma模型层,致其偏好颜色改变 — dejanseo · 2026-08-05
- 开发者实测:DeepSeek Flash表现优秀,失败仅是智力不足 — yacineMTB · 2026-08-05
- MiniMax H3 量化模型与 LoRA 替代来源汇总 — reeight · 2026-08-05
- 离谱体验:用户被 Claude 模型路由连降两级 — basedjensen · 2026-08-05
- 雷军千万年薪挖角 DeepSeek 核心成员罗福莉,执掌小米大模型 — thisdudelikesAI · 2026-08-05