单卡 6000 跑 26 万 Token:KV 量化实战
AIFlow_ML · x · 2026-08-28
通过在单张 RTX PRO 6000 上使用 Qwen 3.8 Flash 配合 NVFP4 和 ngrams 技术,成功分配约 26 万 token 的 KV Cache(FP8)。为了流畅处理多个子智能体,计划实施 KV Cache 量化策略:将 Value 限制为 NVFP4 而 Key 保持在 FP8,以最小化对 Softmax 的负面影响。
「Infra」频道最新
- GPT 大降价致 Token 消用量激增 13.8 倍 — scaling01 · 2026-08-28
- DwarfStar 新增 GLM 5.3 Flash 分支:MacBook 支持张量并行 — antirez · 2026-08-28
- NVIDIA 收购 llama.cpp 后,二手 V100 还能当低价显存捷径吗? — OnlineParacosm · 2026-08-28
- 特朗普半导体关税政策或引发美数据中心危机 — pstAsiatech · 2026-08-28
- 实测:Qwen 3.8 Flash Next 在低配硬件上的表现 — Agitated_Force_9199 · 2026-08-28
- SP1 Prover 上 Metal GPU 实测:BTC 头证明提速 6 倍、内存省半 — StefanoGogioso · 2026-08-28