RTX 5080 跑 Qwen 3.5 35B 达 18 token/s 实测

Sweaty_Perception655 · reddit · 2026-08-10

一位开发者在 Ubuntu 系统下,使用 Radeon 7600 显卡(搭配 64GB DDR4 内存和 Ryzen 5600 处理器),通过 llama.cpp 成功以 18 token/s 的速度运行 Qwen 3.5 35B A3B-Q80 gguf 模型。

作者分享了具体的运行配置参数,包括将 37 层 MoE 卸载到 CPU(--n-cpu-moe 37),关闭 mmap,使用 Q8 量化精度的上下文(-ctk q80 -ctv q80),以及开启 Flash Attention(-fa 1)和设置 9000 的上下文长度。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →