RTX 3090 跑通 27B 模型+20 万上下文

MaziyarPanahi · x · 2026-09-01

MiaAI Lab 发布了 Qwen3.8-27B 的 EXL3 量化部署方案,结合 DFlash2 推测解码技术,实现了在 24GB 显存(如 RTX 3090)上运行 20 万上下文。项目包含启动脚本、配置和 OpenAI 兼容服务端,利用 NVFP4 KV 缓存最大化上下文吞吐。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →