单张RTX 3090跑百万token上下文:KVarN量化突破极限
Anbeeld · reddit · 2026-08-10
开发者 Anbeeld 分享了一项极具极限的本地大模型部署测试:有用户成功在单张 RTX 3090(24GB 显存)上,为占用约 17GB 显存的 Qwen 3.5 35B A3B 模型加载了近 100 万 token 的上下文。
测试不仅验证了服务器未崩溃,更在超长文本的不同位置成功提取了 7 根“针”(精准信息检索),证明模型在极限量化下依然保持了有效的长文本理解能力。
这一突破得益于 BeeLlama.cpp 分支与华为提出的 KVarN(方差归一化 KV-Cache 量化)技术。相比传统的 4-bit 量化,KVarN 在极低比特率下展现出更优的精度,彻底改变了业界对低比特 KV 缓存量化的性能预期。
「Infra」频道最新
- 实测 30B 模型跑出 114 tps,优化后有望在 16G 显存运行 — tokenbender · 2026-08-10
- 算力之后的新瓶颈:AI 数据中心面临电力短缺挑战 — ingliguori · 2026-08-10
- Discovered Materials 获 900 万美元融资,用 AI 挖掘高效散热芯片材料 — TechCrunch AI · 2026-08-10
- RTX 5090本地跑MiniMax H3:int8与nvfp4量化版怎么选? — Zerozone000 · 2026-08-10
- RTX 5090 跑 MiniMax H3 视频生成卡顿 1 小时 — Johnwick1536 · 2026-08-10
- 单卡 H200 提升 41% 吞吐:LLM 离线蒸馏新法大幅降低显存 — MultiverseComputingCAI · 2026-08-10