Reddit 网友魔改 llama.cpp:双卡异构跑 Qwen3 27B 至 262k 上下文

comperr · reddit · 2026-09-19

Reddit 用户 comperr 展示在 RTX 5090 + RTX 3090 Ti 双卡异构环境下,让 Qwen3 27B 的 Q4KM 自制量化版跑出 262k 上下文。他移植并改造了 ollama 分支的 llama.cpp,实现 NVFP4 KV cache 支持,过程要点:

对想在消费级双卡上做长上下文本地部署/量化开发的用户有直接参考价值。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →