双 RTX 3090 跑 Flash-Next:Go-LLM 指南给出完整 vLLM 部署配方
Motor_Ad16 · reddit · 2026-09-15
作者 majidkorai 开源了 Go-LLM 仓库,整理了用 vLLM 运行 Qwen3.8-Flash-Next 的完整工作笔记,只含指南/配置/脚本,不含模型权重与私有设施。
- 两条路径:官方上游路线用 vLLM nightly 镜像 + DGX Spark 等 Blackwell 级硬件 + NVFP4 checkpoint;本地绕行路线用 vLLM 0.29.0 的 GGUF 支持 fork,在双 RTX 3090(sm86)上运行,附补丁、环境变量与启动配方
- 本地稳定推荐 IQ4XS 量化:1k 解码约 36.5 tok/s,32k 解码约 31 tok/s,126k 解码约 19 tok/s,32k 全新 prefill 约 1104 tok/s
- Q4KXL 仅作实验性:1k 解码约 32.3 tok/s,长上下文不稳定,大规模分载分配后出现性能退化与崩溃
- 内容包括启动配方、补丁说明、env 示例、systemd 单元、排障笔记与诚实免责:早前约 6665 tok/s 的 prefill 数字在文档配置下无法复现,不应作为预期结果宣传
「Infra」频道最新
- 英伟达单季收入 962 亿美元,用金融 AI 拆解财报里的真金白银与未来承诺 — nikola_mr64990 · 2026-09-15
- MIT 评测:AI 巨头明年豪掷 1.1 万亿美元,自身生产率需提升 2.7 倍才能回本 — nordicinst · 2026-09-15
- Weaviate + Ollama 本地向量检索配置:数据不出内网的两步走 — philipvollet · 2026-09-15
- 客服机器人每轮注入 25 万 token,开发者晒「不用 RAG」方案求反驳 — louay_Sallakho · 2026-09-15
- MinIO:S3 兼容开源对象存储,出口流量零费用 — thisguyknowsai · 2026-09-15
- GPU 程序员的黄金法则:先测数据搬运耗时,再决定要不要移植 — Franc0Fernand0 · 2026-09-15