开源硬件 Roofline 计算器:一步估算 LLM 推理速度理论上限
Informal-Trouble2183 · reddit · 2026-09-28
一位开发者发布了 LLM 推理硬件 Roofline 计算器,可根据模型架构、量化方案、GPU、显存带宽等参数,估算 decode/prefill 阶段的理论性能上限。作者强调这是理论边界而非实测,但适合作为「第 0 步」检查:判断你的硬件能装下什么模型、各瓶颈参数如何影响性能。工具可在 ai-leaderboard.dev 点击 HW Roofline 使用。
「Infra」频道最新
- 6 张 RTX 6000 满血 325W 长期运行, GPU 温度仅 41°C — TheZachMueller · 2026-09-28
- RTX 3090 本地跑 MiniMax H3 视频生成:每步 6294 秒还翻车 — play150 · 2026-09-28
- 16GB 显卡跑 177B MoE:SSD 流式推理实测 9-10 tok/s — TypicalPudding6190 · 2026-09-28
- Innosilicon:中国芯片公司背后的关键 IP 供应商 — pstAsiatech · 2026-09-28
- 带视觉仅 17GB:Swift-Qwen3.8-27B GGUF 在双 5060 Ti 上实测 76 tok/s — Then_Blueberry7290 · 2026-09-28
- 自研 Gem16 引擎:5080 笔记本 16GB 跑 Gemma4 26B,182 tok/s — Danmoreng · 2026-09-28