网友爆料:DeepSeek 新模型疑为华为昇腾训练
teortaxesTex · x · 2026-09-30
X 用户 teortaxesTex 表示,他不相信 DeepSeek 在发布已达 GEMM 99.8%、MegaMoE 98% 硬件上限的开源 kernel 之后,却没有端到端训练出任何可用模型。他猜测,传闻中的 DeepSeek 小型单 GPU 模型至少部分可能是在华为昇腾(Ascend)硬件上训练的。该说法目前仅为个人推测,未获证实。
所属事件:DeepSeek 新模型被曝或用华为昇腾训练(3 条相关)→
「Infra」频道最新
- GPU 空转高达 74%,微软研究院 SortedRL 直击 RL 训练调度瓶颈 — burkov · 2026-09-30
- 两年前还在写讣告的 Intel 迎来逆转,传其工艺良率已达 80% — 2C_ornot2C · 2026-09-30
- H100 租金半年涨 30%,RunPod 涨至每卡时 $3.49 — julsimon · 2026-09-30
- 明尼阿波利斯机场启用爱立信私有 5G,覆盖除雪车与电车摄像头 — shashib · 2026-09-30
- 量化 softmax 预训练 Transformer:K=16 时验证损失仅增 0.004 nats — illinois · 2026-09-30
- xLLM 训练推理基础设施全套开源,含 xattn 与 xBridges — HongyiWang10 · 2026-09-30