老树开新花:开发者开源 V100 专属内核,Qwen 27B 推理狂飙至 366 t/s

Simple_Library_2700 · reddit · 2026-08-12

Reddit 网友 dnv2003 发布了名为 v100-skinny 的开源项目,针对 Nvidia V100(sm70 架构)显卡深度优化了 NVFP4 权重的推理内核,并实现了几乎零成本的投机解码。

实测数据显示,在最佳的多标记预测(MTP)提取场景下,Qwen 27B 模型的生成速度可达惊人的 366 t/s。在常规代码生成等场景下,速度也能维持在 200-240 t/s 左右。作者在帖子和 GitHub 仓库中详细说明了达成该极限速度的各项前提条件与注意事项。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →