RX 6700 XT 上压榨 Qwen 35B:llama.cpp 百k 上下文调优实录
Loose_Doubt367 · reddit · 2026-09-03
作者在 RX 6700 XT 12GB + Ryzen 5600X 上跑 unsloth Qwen3.6-35B-A3B Q4KM,坚持 100k 上下文、Q4 量化不动,目标是 45 tokens/sec。分享了编码与通用两套 llama-server 启动命令,包含 KV cache q80 量化、ngram/MTP 投机解码、batch/ubatch 与线程优先级等参数,并在求助更多冷门提速选项。
「Infra」频道最新
- Nvidia 纵向整合信号显现,或将自建应用层对抗 OpenAI — RachelVT42 · 2026-09-03
- ARK 中期复盘:AI 算力与基建扩张持续超预期 — downingARK · 2026-09-03
- 自购二手 8xA100 服务器托管?Reddit 用户算账个人算力生意 — Alarming-Ad8154 · 2026-09-03
- AI 服务器藏着隐形成本:PCB 钻头消耗远超行业增速 — tengyanAI · 2026-09-03
- Vera Rubin NVL72 跑 DeepSeek R1 每兆瓦 token 量较 GB200 提升近 10 倍 — Beth_Kindig · 2026-09-03
- 腾讯混元 770B 模型量化后从 1.5TB 压到 214GiB — Aiden_Tech_Ai · 2026-09-03