Qwen 3.8 27B 跑出 70t/s:参数配置全公开
dsdt · reddit · 2026-08-20
分享了在双 RTX 5060 Ti (32GB) 上运行 Qwen3.8-27B-UD-Q6K 的“完美配置”,通过一系列参数优化(如 speculative decoding、flash-attn、调整 batch size 等)实现了约 68-70 t/s 的生成速度,草稿接受率达 80%。
「Infra」频道最新
- 深度复盘 a16z 基础设施团队:押注 OpenRouter 与 Cursor — nmasc_ · 2026-08-20
- 为 Alchemy 本地模拟器补全 Floci 缺口 — samgoodwin89 · 2026-08-20
- 利用 Agent 驱动修复 AWS 模拟器服务缺口 — samgoodwin89 · 2026-08-20
- Ramp 推出 LLM 网关:统一模型接口,宣称降本 40% — KlausCodes · 2026-08-20
- 黑客移植 PhysX 至 AMD 显卡,性能达 RTX 5090 六成 — animesh_garg · 2026-08-20
- 为什么Qwen3.8 27B比DSv4 Flash贵?KV cache和量化是关键 — ihatebeinganonymous · 2026-08-20