老机新用:IBM AC922 跑 Qwen 推理预填充达 7357 tok/s
okoyl3 · reddit · 2026-10-05
作者 fork 推理引擎 Strata,为 2018 年的 IBM AC922(双路 POWER9 + 4×V100 SXM2,NVLink 统一内存)深度改造,跑 Qwen 8B 的 UD-Q4KXL 量化模型,性能从 llama.cpp 原本的 130 tok/s 预填充 / 15 tok/s 解码大幅提升:
- 预填充峰值 7357 tok/s,252K token 长提示下仍达 7090 tok/s(35 秒读完)
- 解码约 113 tok/s(JSON),代码约 100,散文约 84(MTP 投机解码)
- 252K 深度追问首 token 仅 0.26 秒,60 tok/s
- 72 GiB 专家权重全部 page-lock 在双路内存,GPU 经 NVLink 2.0 以约 70 GB/s 拉取
技术要点包括 FP16 替代 BF16、显存管理、专家缓存上 GPU、NVLink 利用率和 Tensor Core 调度,过程中用 Claude Code 反复迭代并用 nsight nsys 排查时间空洞。已开源:github.com/eelgaev/Strata-AC922。
「Infra」频道最新
- 本地小模型能干什么:扫描代码库、复盘 AI 会话、整理媒体库 — natesiggard · 2026-10-05
- 把 antirez 的 ds4 砍到 45k 行:Qwen3.8 Flash Next 在 Metal 上快 10% — Chida82 · 2026-10-05
- Hugging Face 突发宕机,正值 NeurIPS 论文投稿最后一天 — silver__tsuki · 2026-10-05
- 矿卡改FPGA跑Qwen3.5:280美元卡上9B INT4推理实测 — I_am_purrfect · 2026-10-05
- 玩家实测 DLSS5:一次切换抵五年图形技术进步 — ctnzr · 2026-10-05
- 800G/1.6T DSP 全线紧缺,MaxLinear 1.6T 芯片仍处送样阶段 — iamfabian · 2026-10-04