单卡 6000 跑 26 万 Token:KV 量化实战

AIFlow_ML · x · 2026-08-28

通过在单张 RTX PRO 6000 上使用 Qwen 3.8 Flash 配合 NVFP4 和 ngrams 技术,成功分配约 26 万 token 的 KV Cache(FP8)。为了流畅处理多个子智能体,计划实施 KV Cache 量化策略:将 Value 限制为 NVFP4 而 Key 保持在 FP8,以最小化对 Softmax 的负面影响。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →