Qwen3.8-27B 实测:单卡 Blackwell 跑出 268 tok/s
EAccelerate_42 · x · 2026-08-24
开发者发布了 Qwen3.8-27B 模型在单块 RTX PRO 5000 Blackwell (48GB) 上的优化方案。利用 SGLang、DFlash2 block-16 和 Triton 注意力机制,在完整 262K 上下文下达到了平均 267.8 tok/s(峰值 310.7),比 EAGLE 基准快 2 倍。项目提供了可复现的安装与测试脚本。
「编程与Agent」频道最新
- 爸爸实测 Claude Code 远程控制:利用碎片时间写代码 — daniel_mac8 · 2026-08-24
- 实战讨论:如何将本地大模型融入工作流产生价值 — ThomasAger · 2026-08-24
- Agent 超时后如何处理可能已执行的操作? — Real_KingZeotic · 2026-08-24
- 安全扫描:三分之一公共 MCP 服务器缺乏危险操作提示 — Dear-Potential2625 · 2026-08-24
- Infinitty 0.2.6 发布:基于 Swift 的原生多智能体终端 — jasonkneen · 2026-08-24
- Anthropic 工程师:用 Opus 对 CPU、内存、CI 时长做爬山优化 — BLUECOW009 · 2026-08-24