3x RTX A4000 跑 Qwen3.8 27B Q8 配置与性能

LevelSoft1165 · reddit · 2026-08-21

用户分享了在 3 张 RTX A4000 (16GB) 显卡上运行 Qwen3.8 27B Q8 量化模型的配置文件。当前使用 llama.cpp,开启 MTP 优化,平均速度约为 23 tokens/s。用户寻求进一步提升速度的建议。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →