同一块 GB300 同一负载,仅换推理引擎基准结果相差 11 倍
Slight_Republic_4242 · reddit · 2026-09-15
关键发现
SemiAnalysis InferenceX(9 月 15 日,部分付费)的 Rubin vs GB300 数据,标题是硬件对比,但更有价值的是固定硬件、只换 serving engine 后的结果变化:
- 在 170 TPS 交互性目标下,Rubin 相比跑 TRTLLM 的 GB300 每兆瓦 token 数高出 62.9 倍;但同样的 GB300 换成 SGLang 后,Rubin 的领先缩水到 5.56 倍——GB300 仅因引擎选择基准结果移动了约 11 倍
- 注意 caveat:170 TPS 接近 TRTLLM 被测曲线的最快点,是 TRTLLM 自己掉出曲线,而非 SGLang 有魔法;100 TPS 时两者接近得多(21.1M vs 28.5M tok/s/MW)
- 排序随目标位置翻转:75 TPS 时 TRTLLM 领先,更高目标时 SGLang 领先
- GB300 + SGLang 能达到与 Rubin 大致相同的最大交互性——这条被埋在一篇以硬件倍数为标题的文章里
结论
原文自己的话:「引用高交互性增益时必须标注引擎。」吞吐量数字是硬件+引擎的二元组,单个不含引擎名的倍数什么也测不了——小规模自建部署(vLLM/SGLang/llama.cpp)同样是这个陷阱。
「Infra」频道最新
- Orthrus 研究揭示:无损投机解码仅在高数值精度下成立 — Ilya Koziev · 2026-09-15
- M3 Ultra 跑 DeepSeek V4.1 Flash 提速近一倍:31 t/s 解码、40 t/s 投机 — IngeniousIdiocy · 2026-09-15
- Trigger.dev 推出 chat.agent:AI 对话变成可崩溃恢复的长任务 — CodeByPoonam · 2026-09-15
- 甲骨文凌晨 6 点批量裁员:AI 订单膨胀烧钱,员工年减 2.1 万 — 量子位 · 2026-09-15
- 光伏降至每瓦 0.12 美元,或成 2030 年后数据中心扩产关键 — kimmonismus · 2026-09-15
- RTX 5090 上最快的本地视觉模型选型求教 — StartupTim · 2026-09-15