RX 6700 XT 上压榨 Qwen 35B:llama.cpp 百k 上下文调优实录

Loose_Doubt367 · reddit · 2026-09-03

作者在 RX 6700 XT 12GB + Ryzen 5600X 上跑 unsloth Qwen3.6-35B-A3B Q4KM,坚持 100k 上下文、Q4 量化不动,目标是 45 tokens/sec。分享了编码与通用两套 llama-server 启动命令,包含 KV cache q80 量化、ngram/MTP 投机解码、batch/ubatch 与线程优先级等参数,并在求助更多冷门提速选项。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →