爆料:DeepSeek 曾训练 3T 参数模型,因经济性暂缓发布
zephyr_z9 · x · 2026-09-10
teortaxesTex 称从可靠渠道得知 DeepSeek 曾在做 3T 参数骨干模型(可能另有约 1T 参数的 Engram,属其推测),但不确定后训练和服务在商业上是否划算,等集群扩张后会看到成果。被引用的 willcb 推测 DeepSeek 借「flash」路线酝酿 2T+ 参数的 V4.5 Pro,frontier 级模型 5 美元/百万 token 可期。
所属事件:爆料:DeepSeek 或已训练 3T 参数模型因经济性暂缓发布(3 条相关)→
「模型」频道最新
- DeepSeek V4.1 论文获赞:像全领域的教科书,先讲数据后讲基建 — teortaxesTex · 2026-09-10
- 实测:Google AI Mode 未登录用户引用来源三周内锐减 72% — gaganghotra_ · 2026-09-10
- DeepSeek 自曝 CED 架构灵感来自 2024 年 YoCo 论文 — jm_alexia · 2026-09-10
- DeepSeek 效率研究将成本压降超 10 倍,架构成降价唯一数学变量 — ChengleiSi · 2026-09-10
- DeepSeek 发布非对称新架构:552B MoE,输入仅激活 8B — ChengleiSi · 2026-09-10
- 13 步手推 Switch Transformer:看懂 MoE 为何省算力 — ProfTomYeh · 2026-09-10