Qwen3.8-27B 优化:长上下文解码提速 3 倍

stargate425 · reddit · 2026-08-22

技术分享显示,通过使用 DFlash2 + XQA 配置,Qwen3.8-27B 模型在 192K 上下文下的解码速度显著提升。在 RTX PRO 6000 Max Q 上实测,BF16 精度下解码速度从 18 tok/s 提升至 58 tok/s,且保持无损。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →