DeepSeek V5 爆料:2 万亿参数,或首次全部用华为昇腾训练
teortaxesTex · x · 2026-09-27
X 用户 @Priyannkaaaa 爆料称 DeepSeek 正准备发布 V5:
- 据称约 2 万亿参数(而非此前传的 3T),被创始人梁文锋称为公司迄今最大的一次押注
- 传闻为 首个完全基于华为昇腾芯片训练 的 DeepSeek 模型,不再用 Nvidia;但同规模训练所需昇腾加速器约为英伟达方案的 4 倍
- 据称将延续开放权重(open-weight)策略
- 另有来自尼日利亚的所谓"独立旁证",发帖人 teortaxesTex 半调侃地认为消息已传到千里之外,事件不小
以上均为未经证实的传闻。
「Infra」频道最新
- Nix 作者社区推 Casita:面向 Agent 时代的 Rust 重写包存储 — letandrewcook · 2026-09-28
- 传中国考虑放行字节跳动与阿里恢复采购新款英伟达芯片 — Polymarket · 2026-09-27
- SpaceX CFO 称 AI 是 Starlink 需求暴增主因,星链或成轨道算力层 — elonmusk · 2026-09-27
- 玩家组四卡 RTX PRO 6000 塔式机,275W 功耗墙压温 80°C 以下 — TheZachMueller · 2026-09-27
- MLX-Serve 27B 推理提速:分支猜测一次验证,较上版快 32% — TheMoonMidas · 2026-09-27
- 哈佛免费开放 CS249r:从芯片到推理的全栈 ML 系统课 — techNmak · 2026-09-27