单张RTX 3090跑百万token上下文:KVarN量化突破极限

Anbeeld · reddit · 2026-08-10

开发者 Anbeeld 分享了一项极具极限的本地大模型部署测试:有用户成功在单张 RTX 3090(24GB 显存)上,为占用约 17GB 显存的 Qwen 3.5 35B A3B 模型加载了近 100 万 token 的上下文。

测试不仅验证了服务器未崩溃,更在超长文本的不同位置成功提取了 7 根“针”(精准信息检索),证明模型在极限量化下依然保持了有效的长文本理解能力。

这一突破得益于 BeeLlama.cpp 分支与华为提出的 KVarN(方差归一化 KV-Cache 量化)技术。相比传统的 4-bit 量化,KVarN 在极低比特率下展现出更优的精度,彻底改变了业界对低比特 KV 缓存量化的性能预期。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →