RTX 5090 跑 Qwen 3.6 27B 实测:262k 上下文速度达 40 t/s

Gargle-Loaf-Spunk · reddit · 2026-08-08

一位开发者在 RTX 5090 上使用 llama.cpp 实跑了 Qwen 3.6 27B 模型(Q6K 量化),并分享了针对编码任务优化的启动参数。

性能表现

关键参数调整经验

作者同时开启了 MTP 投机采样(--spec-type draft-mtp)等高级特性以榨干性能,并呼吁社区交流各自的配置心得。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →