3090 单卡跑出 140 tok/s:自写 megakernel 比 llama.cpp 快 1.9 倍
Adorable_Weakness_39 · reddit · 2026-10-10
发帖人用 Claude Opus 5.5 协助,为 RTX 3090 上的 Qwen3.8-27B(unsloth Q4KM)写了一个 CUDA megakernel,把整个投机解码循环放进一次 kernel launch,使检查 4-5 个草稿 token 的成本接近检查 1 个。与 llama.cpp(含 MTP)同硬件对比:
- 写代码:140 tok/s vs 73(1.9x)
- 4K token 文件上下文写代码:95 vs 56(1.7x)
- prompt 处理(prefill):约 1,600 vs 约 1,100 tok/s(1.4x)
服务器兼容 OpenAI API,可作 llama server 的即插即用替代。局限:仅针对 3090 单一模型构建;输出与 llama.cpp 一致(除极少平局舍入差异);KVCache fp16 支持到约 80k 上下文,之后转 q8。代码与完整基准已开源在 GitHub 的 open-jet/megakernel。
「Infra」频道最新
- 256GB DDR5 涨到 7200 美元,工程师把它当保值资产抢购 — CtrlAltDwayne · 2026-10-10
- Lemire 2026 重测 WebSocket:Bun 曾被高估, Anthropic 买下 Bun、Cloudflare 买下 Deno — lemire · 2026-10-10
- Cornell/IBM 新论文:共享 KV 缓存让循环模型省 76-79% 内存还更准 — yoavartzi · 2026-10-10
- Cascade 拓扑反而更慢?多卡 P2P 通信的 PCIe 跳数陷阱 — TheZachMueller · 2026-10-10
- 香港实测:5090 整机近 9 万港币,5090 停产传闻可信度高 — karminski3 · 2026-10-10
- Orbio 融资 120 万美元,要让 AI Agent 自己 provisioning 算力 — econoar · 2026-10-10