双 RTX 6000 跑 Qwen3.8-27B:吞吐 150t/s 却比 Claude 慢 12 倍
EkbatDeSabat · reddit · 2026-08-24
发帖者在两张 RTX 6000 Pro 上用 SGLang 部署 Qwen3.8-27B FP8,吞吐约 150 token/s 看似不错,但完成一个「读大量文档并给出项目状态更新」的基线任务要近 2 小时,而 Opus 5 十分钟内搞定——差距达 12 倍。任务会先吃掉 80k 上下文,主 agent 再分出子 agent,其中一个卸载到第二张 GPU。
作者分享了完整部署配置:每卡一个 Docker 容器跑 SGLang,256k 上下文、FP8 KV cache(fp8e4m3)、mem-fraction 0.90、max-running-requests 4、chunked-prefill 8192、qwen3 reasoning/tool-call parser,并启用 EAGLE 投机解码(3 步、topk 1、4 个 draft token)等。
对比测试发现:BF16 主卡 + FP8 卸载反而更慢(约 3 小时);500k 上下文虽非官方支持却比 256k 快约 1 小时。测试横向覆盖 Claude Code、pi code、qwen code、Hermes,表现相近。作者疑惑这是否是 27B 思维链的固有代价,下一步打算换掉 SGLang 再测。
「编程与Agent」频道最新
- 从脚本到循环:Agent 生产系统的工程化挑战与解决方案 — Pavan_Belagatti · 2026-08-25
- AWS推出Agent Registry与ARD开放规范,让智能体跨环境可被发现 — AWS ML Blog · 2026-08-25
- Apodex 1.1 发布:支持异步多 Agent 协作 — KaiyuYang4 · 2026-08-25
- AI Agent 擅长事实核查,但可能降低大规模监控成本 — OwainEvans_UK · 2026-08-25
- Grok Bot 源码因未关闭 Source Maps 被完整逆向还原 — dotey · 2026-08-25
- 自研 MCP 工具实现跨编码会话上下文同步 — notinteresteddddd · 2026-08-25