RTX 3090 跑通 Qwen2.5-72B:预填 2000 tok/s
iamMess · reddit · 2026-09-01
开发者在 RTX 3090 上优化 Qwen2.5-72B (Qwen3.8-27B 指代) 推理,实现预填速度 2000 tokens/s、解码速度 132 tokens/s。核心改进是自定义内核,在 int8 下达到与 fp32 0.99997 的相似度,几乎无质量损失。作者认为解码速度已达当前极限,并提供了 GitHub 仓库供测试。
「Infra」频道最新
- 算力之前还有电力与冷却:AI竞争正下沉到基础设施栈 — ingliguori · 2026-09-01
- Comet 推出开源 LLM 可观测性工具 Opik — dl_weekly · 2026-09-01
- VMware 专家:企业私有 AI 兼具经济与合规优势 — DavidLinthicum · 2026-09-01
- Rust 打造的轻量级浏览器 Obscura,专为 AI Agent 设计 — Shruti_0810 · 2026-09-01
- 算力上天成本高:发射费是地面建造成本 20 倍 — aronchick · 2026-09-01
- 从 NVIDIA 转 AMD 9060XT:文生图工作流迁移与性能实测 — Tayunskapon · 2026-09-01