Strix Halo + 3090 Ti 跑 Qwen Flash-Next:提速至 84 tok/s
TrifleHopeful5418 · reddit · 2026-09-02
用户在 AMD Strix Halo (395, 128GB) + RTX 3090 Ti eGPU 的异构配置上运行了 104GB 的 Qwen3.8-Flash-Next 模型。通过 7 项针对性优化(如修复 DeltaNet 快照回滚的 PCIe 传输、优化 iGPU 缓冲区读取路径、关闭多流推测等),成功将吞吐量从 22.2 tok/s 提升至多流聚合 84 tok/s。在 HumanEval+ 测试中,该本地配置的中位数任务耗时(22.5s)仅为远程双 3090 vLLM 集群(58.9s)的 0.4 倍,且仅差一题即通过所有测试。
「Infra」频道最新
- DeepSeek Engram 架构被 Qwen/Longcat 采用省显存 — bookwormengr · 2026-09-02
- 戴尔季度营收 470 亿美元创纪录,AI 基础设施需求提振业绩 — Polymarket · 2026-09-02
- 因内存成本暴涨,Nvidia Rubin Ultra 显存减半至 192GB — rwang07 · 2026-09-02
- 斯派塞X团队大换血,马斯克引入火箭业务高管接管数据中心 — kyliebytes · 2026-09-02
- 求购数据中心级光交换机 — jwt0625 · 2026-09-02
- GB10 涨价引热议,Mac Studio 是否成为当前算力性价比之王 — geekender · 2026-09-02