3x RTX A4000 跑 Qwen3.8 27B Q8 配置与性能
LevelSoft1165 · reddit · 2026-08-21
用户分享了在 3 张 RTX A4000 (16GB) 显卡上运行 Qwen3.8 27B Q8 量化模型的配置文件。当前使用 llama.cpp,开启 MTP 优化,平均速度约为 23 tokens/s。用户寻求进一步提升速度的建议。
「Infra」频道最新
- 异构计算系统实测:新硬件组合击败前沿模型 — ShahabBakht · 2026-08-21
- AMD MI300x vs 英伟达 H100:Agent 编码实测对比 — locker73 · 2026-08-21
- 退订 Claude Pro:玩家用 5090 本地跑 Qwen 接续全部工作 — SOC_FreeDiver · 2026-08-21
- AI 路由新趋势:为特定任务匹配最佳模型与Harness — richdotca · 2026-08-21
- 阿里季利润暴跌 75%,重金投入 AI 算力基建 — Polymarket · 2026-08-21
- TorchSpec 合并 DFlash2 训练支持,新增 Qwen3-8B 配方 — zhyncs42 · 2026-08-21