Strix Halo + 3090 Ti 跑 Qwen Flash-Next:提速至 84 tok/s

TrifleHopeful5418 · reddit · 2026-09-02

用户在 AMD Strix Halo (395, 128GB) + RTX 3090 Ti eGPU 的异构配置上运行了 104GB 的 Qwen3.8-Flash-Next 模型。通过 7 项针对性优化(如修复 DeltaNet 快照回滚的 PCIe 传输、优化 iGPU 缓冲区读取路径、关闭多流推测等),成功将吞吐量从 22.2 tok/s 提升至多流聚合 84 tok/s。在 HumanEval+ 测试中,该本地配置的中位数任务耗时(22.5s)仅为远程双 3090 vLLM 集群(58.9s)的 0.4 倍,且仅差一题即通过所有测试。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →