RTX 4090 跑通 25 万上下文:单卡优化 Qwen 3.8 实践

alexcovo_eth · x · 2026-08-23

博主通过技术优化在单张 RTX 4090 (24GB) 上成功运行 Qwen 3.8-27B 模型,实现了 250,000 的上下文窗口和 75 tokens/s 的速度。

核心优化手段:

实测结果:

结合 Q2K drafter 和 --parallel 1 标志,上下文限制显著提升,最终在单卡上实现了惊人的 25 万上下文吞吐。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →