老树开新花:开发者开源 V100 专属内核,Qwen 27B 推理狂飙至 366 t/s
Simple_Library_2700 · reddit · 2026-08-12
Reddit 网友 dnv2003 发布了名为 v100-skinny 的开源项目,针对 Nvidia V100(sm70 架构)显卡深度优化了 NVFP4 权重的推理内核,并实现了几乎零成本的投机解码。
实测数据显示,在最佳的多标记预测(MTP)提取场景下,Qwen 27B 模型的生成速度可达惊人的 366 t/s。在常规代码生成等场景下,速度也能维持在 200-240 t/s 左右。作者在帖子和 GitHub 仓库中详细说明了达成该极限速度的各项前提条件与注意事项。
「Infra」频道最新
- Mistral聚合欧洲长期算力需求,推出European Compute Units — MistralAI · 2026-08-12
- Mistral 发布欧洲主权 AI 计划:聚合算力需求并引入第三方开源模型 — MistralAI · 2026-08-12
- 从第一性原理拆解 LLM 推理成本 — charles_irl · 2026-08-12
- CoreWeav Q2 营收 26 亿美元,积压订单超千亿 — shawnup · 2026-08-12
- 马斯克:AI推理将走向太空,SpaceX目标10GW算力 — tetsuoai · 2026-08-12
- 如何在 RTX 4500 上加速 Minimax M3 视频生成? — Peregrine2976 · 2026-08-12