两张 96GB 昇腾卡本地跑 Qwen:从 1 tok/s 调到 30 tok/s 全记录
matteiuspi · reddit · 2026-10-02
作者用两张华为 Atlas 300I Duo(共 4 个 Ascend 310P3 设备,每卡 96GB LPDDR4X,共 192GB)搭建本地推理机,跑 Qwen3.8 Flash-Next:
硬件要点
- 每卡实为双芯片,各 48GB 本地显存,需张量/专家并行;应视作 4 个 48GB rank 而非 2 个 96GB GPU
- LPDDR4X 而非 HBM,带宽 408 GB/s,PCIe Gen4 x16,单槽 150W
- 被动散热可行:直吹大风量+空调房间,实测 72–78°C(看门狗 96°C)
软件调优
- 初始乱码且约 1 tok/s;两周后在 vLLM/vLLM Ascend 上改驱动支持、模型架构、内存布局、自定义算子、异步状态转换
- 现单请求约 30 tok/s,四路并发合计约 61 tok/s,并跑完全部 198 题 GPQA Diamond
- 计划扩到 3 卡 6 设备、288GB 名义/258GiB 可见显存、450W
「Infra」频道最新
- AI 基建投入占 GDP 已超当年铁路,但仅 30% 标普 500 量化披露 AI 影响 — FinanceYF5 · 2026-10-02
- 全双工语音推理成本虚高 56 倍,自研引擎实现单卡 H100 并发 56 路 — Ok_boss_labrunz · 2026-10-02
- Cloudflare 推出 SQL API:Workers 日志与追踪可直接用 SQL 查询 — irvinebroque · 2026-10-02
- Cloudflare 推出 AI Gateway Web Search API,统一接入三家搜索商 — michellechen · 2026-10-02
- Zig 从零写的机器浏览器 Lightpanda 1.0 正式发布 — jedisct1 · 2026-10-02
- 24GB 显卡塞下 Qwen3.8-27B 编码模型:262k 上下文仍有 40 t/s — W61k3r · 2026-10-02