单张 3090 跑 Qwen3.8-27B 达 140 tok/s:CUDA megakernel 精度对齐 llama.cpp

Adorable_Weakness_39 · reddit · 2026-10-11

作者更新其 CUDA megakernel 项目:在单张 RTX 3090 上以 Q4KM 量化运行 Qwen3.8-27B,速度达 llama.cpp 的 1.4-1.9 倍,并补齐了精度验证数据。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →