双 RTX 6000 跑 Qwen3.8-27B:吞吐 150t/s 却比 Claude 慢 12 倍

EkbatDeSabat · reddit · 2026-08-24

发帖者在两张 RTX 6000 Pro 上用 SGLang 部署 Qwen3.8-27B FP8,吞吐约 150 token/s 看似不错,但完成一个「读大量文档并给出项目状态更新」的基线任务要近 2 小时,而 Opus 5 十分钟内搞定——差距达 12 倍。任务会先吃掉 80k 上下文,主 agent 再分出子 agent,其中一个卸载到第二张 GPU。

作者分享了完整部署配置:每卡一个 Docker 容器跑 SGLang,256k 上下文、FP8 KV cache(fp8e4m3)、mem-fraction 0.90、max-running-requests 4、chunked-prefill 8192、qwen3 reasoning/tool-call parser,并启用 EAGLE 投机解码(3 步、topk 1、4 个 draft token)等。

对比测试发现:BF16 主卡 + FP8 卸载反而更慢(约 3 小时);500k 上下文虽非官方支持却比 256k 快约 1 小时。测试横向覆盖 Claude Code、pi code、qwen code、Hermes,表现相近。作者疑惑这是否是 27B 思维链的固有代价,下一步打算换掉 SGLang 再测。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →