优化 Qwen 3.8 Flash Next:大显存下提升预填与生成速度
Jorlen · reddit · 2026-09-01
用户探讨在双 R9700 (64GB VRAM) + 32GB RAM 配置下运行 Qwen 3.8 Flash Next (Q4 量化) 的性能优化。当前预填速度约 180 t/s,生成 18 t/s。受限于 32GB 系统内存,无法将模型完全载入 RAM,需依赖 MMAP。用户已启用 flash-attn,并调整了 KV cache 类型和上下文大小,寻求进一步提速方案。
「Infra」频道最新
- Together AI 签署 50 亿美元开源模型算力大单 — graceisford · 2026-09-01
- 英伟达联发科合作,分析师忧博通长期 XPU 业务 — BenBajarin · 2026-09-01
- 欧盟斥资 3.88 亿欧元打造 LUMI-AI 超算 — wkmyrhang · 2026-09-01
- 传 SK 海力士 HBM4E 基底裸片拟外发给英特尔代工 — AccBalanced · 2026-09-01
- 卫报提议数据中心自发电,实现零碳排放 — nordicinst · 2026-09-01
- 算力出地:将下一代智能基础设施搬入轨道的宣言 — McDonaghMatthew · 2026-09-01