Reddit 网友魔改 llama.cpp:双卡异构跑 Qwen3 27B 至 262k 上下文
comperr · reddit · 2026-09-19
Reddit 用户 comperr 展示在 RTX 5090 + RTX 3090 Ti 双卡异构环境下,让 Qwen3 27B 的 Q4KM 自制量化版跑出 262k 上下文。他移植并改造了 ollama 分支的 llama.cpp,实现 NVFP4 KV cache 支持,过程要点:
- 计算感知分层:按 CUDAARCH 而非仅 FP16 能力拆分 FA kernel,SM86 与 SM120 走不同路径,输出层锁定在 5090 上以最大化性能
- 修复真实 bug:q80 在 262k 上下文下出现 TILE 边界 nwarps 溢出,修复后双卡均通过;另修了 MXFP4 17B 与 NVFP4 8B 的 SM120 对齐加载错误
- 核心修复:Blackwell 无法对 17 字节块做向量加载,改用逐字节 memcpy(memcpy(&k, K+off17, 17)) 解决 0x7ff95b398141 之类的非对齐访问
- 权重是他自己从 fp16 源用 f16 repack 打包的自制 Q4KM 量化
对想在消费级双卡上做长上下文本地部署/量化开发的用户有直接参考价值。
「Infra」频道最新
- 16GB 显存玩家的真实写照(梗图) — tassa-yoniso-manasi · 2026-09-19
- antirez:API 定价如大富翁钞票,真实度量应是能耗焦耳 — mitsuhiko · 2026-09-19
- 家用微型数据中心绑热水器,伦敦用户月省 10-15 英镑取暖费 — nordicinst · 2026-09-19
- DiffusionGemma 变身 DJev,手机上近实时跑视觉检测 — PMinervini · 2026-09-19
- 35B 三值模型塞进 iPhone:Millie 仅约 4GB 内存离线运行 — MannyKayy · 2026-09-19
- PyTorch 大会将演示 CRCR:下游仓库可无缝接入上游 CI — PyTorch · 2026-09-19