社区作者量化 Qwen3.8 草稿模型:单张 5090 显存省 2.6 倍、上下文 90K 提至 130K
QuixiAI · x · 2026-08-30
- 开发者 nb4ld 在 Hugging Face 发布首个模型 Qwen3.8-27B-DFlash2-NVFP4-RTNcal:对 Qwen3.8-27B 的 DFlash 2 块扩散投机解码草稿模型做校准 NVFP4(W4A4)量化,采用 NVIDIA ModelOpt 布局,SGLang 原生加载。
- 面向单张 RTX 5090(32GB)部署:草稿模型显存从 3.53GB(BF16)降至 1.37GB,KV-cache 上下文从 90K 提升至 130K tokens(+44%),端到端解码速度持平甚至略升(215→228 tok/s),接受率 3.71→3.60(噪声 ±0.2 内视为持平)。
- 输出质量不变:目标模型会验证每个草稿 token。未校准的 round-to-nearest 量化接受率明显掉至 3.26,说明校准很关键。
- 还在 SGLang 源码树上跑了带工具调用的编码 agent 长上下文基准,各上下文档位解码速度与 BF16 持平。
「Infra」频道最新
- Google Cloud Monitoring MCP 连接器发布 — modelcontextprotocol · 2026-09-01
- Distributed.systems发布可审计的Agent基础设施 — arthurcolle · 2026-09-01
- ChatGPT 启用记忆和历史会话是否增加 Token 消耗? — ssunki · 2026-09-01
- 工程师深挖 ROCm,修复 MI350X 推理崩溃并发现 9 个 Bug — AnushElangovan · 2026-09-01
- 40nm 神经动力学芯片:利用电导漂移实现单次迭代 2.12ms 延迟 — maier_ak · 2026-09-01
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01