单张 3090 跑 Qwen3.8-27B 达 140 tok/s:CUDA megakernel 精度对齐 llama.cpp
Adorable_Weakness_39 · reddit · 2026-10-11
作者更新其 CUDA megakernel 项目:在单张 RTX 3090 上以 Q4KM 量化运行 Qwen3.8-27B,速度达 llama.cpp 的 1.4-1.9 倍,并补齐了精度验证数据。
- 精度:与 llama.cpp batched 相比,KL 散度约 0.0007-0.0009 nats,top token 命中率 99% 以上,perplexity 与参考值差距在噪声范围内。
- 速度:写代码 140 vs 73 tok/s;推理模式 78 vs 51;30K 上下文时 73 vs 52;prefill 约 1600 vs 1100 tok/s。提速来自投机解码每轮检查 4-5 个草稿 token(llama.cpp 仅 2 个)。
- 限制:单卡、RTX 30/40/50 系 24GB+,仅在 3090 上调优;3090 可跑 147K 上下文。
- 量化支持:unsloth Q4KM 原生,lmstudio/mradermacher 半兼容,其余回退 llama.cpp。代码开源在 open-jet 仓库,欢迎针对其他卡型调优的 PR。
「Infra」频道最新
- 开发者实测:本地模型已能完成 90% 日常工作 — TheZachMueller · 2026-10-11
- token降价GPU紧俏,博主称Jevons悖论正在AI算力上演 — AccBalanced · 2026-10-11
- 实测本地 AI 写整应用:智能够用,速度仅 Claude 的 20-35% — julianharris · 2026-10-11
- 37ms 等待间隙让 GPU 近 40% 时间空转,修复后碎片化空闲基本消失 — HankYeomans · 2026-10-11
- 做个小 logger 查 OpenAI 账单,竟挖出 11.3 万美元月账单惨案 — Pangji1003 · 2026-10-11
- 马斯克喊话芯片工程师:Terafab 目标每年 10 款芯片设计 — elonmusk · 2026-10-11