RTX 3090 跑通 Qwen2.5-72B:预填 2000 tok/s

iamMess · reddit · 2026-09-01

开发者在 RTX 3090 上优化 Qwen2.5-72B (Qwen3.8-27B 指代) 推理,实现预填速度 2000 tokens/s、解码速度 132 tokens/s。核心改进是自定义内核,在 int8 下达到与 fp32 0.99997 的相似度,几乎无质量损失。作者认为解码速度已达当前极限,并提供了 GitHub 仓库供测试。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →