3090 单卡跑出 140 tok/s:自写 megakernel 比 llama.cpp 快 1.9 倍

Adorable_Weakness_39 · reddit · 2026-10-10

发帖人用 Claude Opus 5.5 协助,为 RTX 3090 上的 Qwen3.8-27B(unsloth Q4KM)写了一个 CUDA megakernel,把整个投机解码循环放进一次 kernel launch,使检查 4-5 个草稿 token 的成本接近检查 1 个。与 llama.cpp(含 MTP)同硬件对比:

服务器兼容 OpenAI API,可作 llama server 的即插即用替代。局限:仅针对 3090 单一模型构建;输出与 llama.cpp 一致(除极少平局舍入差异);KVCache fp16 支持到约 80k 上下文,之后转 q8。代码与完整基准已开源在 GitHub 的 open-jet/megakernel。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →