自研 NVFP4 KV 缓存+YaRN:单卡 5090 跑通 55.5 万上下文
Lumpy-Comedian-1027 · reddit · 2026-09-06
开发者在 NInfer(Qwen 推理引擎)基础上发布 fork,把 QIn3.8-27B 的本地推理能力大幅推进:
- NVFP4 4-bit KV 缓存:从零实现自定义 MMA kernel(m16n8k64),Q/K 量化到 NVFP4、V 保留 BF16 并做 PV 专用解码 kernel;量化前对 K/Q 做 Hadamard 旋转抑制离群值,解码时原地融合量化。每 token 每 KV 头仅 144 字节(int8 为 264,bf16 为 512),显存省 45% 且质量无损(LongBench 与 int8 持平、AIME 96.7%、大海捞针 100%)。
- YaRN 上下文扩展:利用模型 RoPE 配置特点,在 5090 上把原生 262k 扩展到 555k(并发 3+视觉)/600k(并发 1),592k token 输出保持连贯;推算 96GB+ 显卡可达 8M 上下文(未实测)。
- 两级前缀复用 + Host KV 安全网:自研 HostKVSafetyNet(固定内存竞技场、scatter-gather 分配、pin/take 并发协议),支持执行前沿/重写检查点两级前缀匹配与会话键回退;260+ 请求、3 个 330k-470k 并发会话验证,缓存轮次零重复 prefill,H2D 恢复仅 0.4s。
- 性能:400k+ 上下文解码 117 tok/s(MTP 4.62 tok/轮、92% 接受率),414k 缓存会话冷启动 prefill 260s。
- 还包括容错工具调用解析(恢复格式错误的 Qwen 工具调用、嵌套标记处理)与 Responses API 顺序兼容等改进。
「编程与Agent」频道最新
- Codex 在 SSH 无头 Windows 机器上集体卡死,sandbox runner 疑似 Session 0 问题 — Chance-Struggle-6285 · 2026-09-06
- 跨机器 Agent 协作网络怎么搭?开发者热议信任与策略难点 — No_Praline7219 · 2026-09-06
- 要不要为自己的 Agent 微调专用小模型?开发者征集真实成本 — Small_Luck8177 · 2026-09-06
- LLMPvP:自带任意 LLM 的国际象棋/围棋 MCP 排位竞技场 — vudueprajacu · 2026-09-06
- Astra 对比 Fable 5.1 实测:Astra 工程严谨,Fable 写作与指令遵循更强 — returnity · 2026-09-06
- NIS 研究者谈 coding-agent 超越人机协作之处:为新算法造可行策略 — IgorCarron · 2026-09-06