llama.cpp 分支合并 Qwen3.8-Flash 支持,5090 上 Q4 量化跑出 44 tks
giveen · reddit · 2026-08-28
开发者 giveen 向 TheTom/llama-cpp-turboquant 提交 PR(#324),从上游 vLLM PR #27742 移植了 qwen4exp(Qwen3.8-Flash-Next) 的支持。实测在 RTX 5090 上以 Q4 量化并启用 --moe-cache auto,达到约 44 tokens/s 的生成速度。
「Infra」频道最新
- ThursdAI 聊数据中心反弹:有人真算了水和能源账 — altryne · 2026-08-28
- AISI 开源 optstop 工具,降低大模型评测 Token 消耗 — HZoete · 2026-08-28
- 英伟达预测下一财年收入增长约 70%,AI 算力需求持续飙升 — Polymarket · 2026-08-28
- GPU 繁荣下的隐忧:科技公司的循环需求催生泡沫? — DavidLinthicum · 2026-08-28
- 工程探讨:如何优化 DeepSeek Harness 的上下文压缩策略? — shady101852 · 2026-08-28
- NVIDIA Vera 芯片规模出货,为 AI Agent 优化 CPU 瓶颈 — rohanpaul_ai · 2026-08-28