RTX 5090单卡跑Qwen3.8-27B NVFP4:vLLM+256K上下文,147 tok/s
AIFlow_ML · x · 2026-08-16
MiaAI-Lab发布脚本,在单张RTX 5090(32GB)上通过vLLM 0.27.x运行Qwen3.8-27B NVFP4模型,支持原生256K上下文、TurboQuant 4-bit KV缓存(5.5 GiB)和MTP-3投机解码,并暴露OpenAI兼容API。实测单流生成约160 tok/s(MTP-3),完整262,144 token上下文驻留,内置补丁修复了stock 0.27.1的乱码问题(0/15失败 vs 13/15)。
「编程与Agent」频道最新
- Codex 智能路由任务至低成本模型,提升额度利用率 — eyishazyer · 2026-08-16
- SelfMem 论文:让 AI 自主管理记忆,性能提升 48% — alex_verem · 2026-08-16
- Reddit 热议:AI Agent 太烧钱,大家怎么靠它赚钱? — Nucleif · 2026-08-16
- 实测 $20 订阅算力:Claude Code 比 Codex 多 5 倍用量 — Plenty-Emu3740 · 2026-08-16
- 利用 AI 代理简化 Apple Search Ads 命令行操作 — rudrank · 2026-08-16
- Vibe coding 隐患:无法阅读的代码终将导致生产事故 — pbloemesquire · 2026-08-16