RTX 5080 跑 Qwen 3.5 35B 达 18 token/s 实测
Sweaty_Perception655 · reddit · 2026-08-10
一位开发者在 Ubuntu 系统下,使用 Radeon 7600 显卡(搭配 64GB DDR4 内存和 Ryzen 5600 处理器),通过 llama.cpp 成功以 18 token/s 的速度运行 Qwen 3.5 35B A3B-Q80 gguf 模型。
作者分享了具体的运行配置参数,包括将 37 层 MoE 卸载到 CPU(--n-cpu-moe 37),关闭 mmap,使用 Q8 量化精度的上下文(-ctk q80 -ctv q80),以及开启 Flash Attention(-fa 1)和设置 9000 的上下文长度。
「Infra」频道最新
- 解析拖慢 AI 应用的 7 大工程瓶颈 — goyalshaliniuk · 2026-08-10
- 传英伟达认证 300mW 激光并买断大部分供应 — zephyr_z9 · 2026-08-10
- 双卡极限优化:MiniMax-H3 视频生成提速 8 倍 — multimodalart · 2026-08-10
- PyTorch 深度解析:为什么不应释放 Pinned Memory — ezyang · 2026-08-10
- Rust 线性代数库编译至 Wasm,实现浏览器端 6 倍性能提升 — doodlestein · 2026-08-10
- 法国 10GW 电力盈余若用于 AI 数据中心可年入 3500 亿欧元 — emmanuelvivier · 2026-08-10