Qwen3.8-27B 启用 DFlash2 跑满 256k 上下文

maddie-lovelace · reddit · 2026-08-21

在单张 RTX 5090 上测试 Qwen3.8-27B-UD-Q4KXL 模型,启用 DFlash2 草稿模型后,在 256k 上下文下解码速度提升约 2 倍(从 40 tps 提升至 75 tps),预填速度仅牺牲 15%。实测提供了具体的复现命令和参数配置。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →