爆料补注:V4 系列或已有 3T 参数模型, Scaling 风险是关键变量
teortaxesTex · x · 2026-09-10
延续其对 V4.1 Pro 为 3.1T 总参数 MoE 的外推,作者补充:这一推算的前提是不再重演 V4-Pro 阶段遇到的 scaling 问题;但从团队表态看他们对此颇为乐观,且作者认为 3T 规模的模型实际上已经存在。
所属事件:爆料推算 DeepSeek V4.1 Pro 或为 3.1T 参数 MoE 模型(2 条相关)→
「模型」频道最新
- DeepSeek 报告:后训练进步靠更好数据与环境,而非 RL 算法创新 — realsohamparekh · 2026-09-10
- 「鲸鱼回来了」:DeepSeek 疑似发布新报告引发关注 — scaling01 · 2026-09-10
- Engram 架构解析:总权重 500B 级仍胜 GLM 5.3,KV cache 更小 — bookwormengr · 2026-09-10
- 网友约定半年后回看:开源模型达到前沿网络攻击能力会怎样 — xeophon · 2026-09-10
- 挡住 AI 网络攻击的只有厂商分类器,开源模型护栏缺位引发担忧 — AlexBarry4 · 2026-09-10
- Scobleizer 借 AI 长文研判:DeepSeek 或终结「默认 Pro 模型」策略 — Scobleizer · 2026-09-10