Qwen3.8-27B 实测:单卡 Blackwell 跑出 268 tok/s

EAccelerate_42 · x · 2026-08-24

开发者发布了 Qwen3.8-27B 模型在单块 RTX PRO 5000 Blackwell (48GB) 上的优化方案。利用 SGLang、DFlash2 block-16 和 Triton 注意力机制,在完整 262K 上下文下达到了平均 267.8 tok/s(峰值 310.7),比 EAGLE 基准快 2 倍。项目提供了可复现的安装与测试脚本。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →