单卡 3090 实测 8 款视频 VLM:吞吐与首 token 延迟横向对比
SkyLordOmega · reddit · 2026-09-19
作者因参与 NIST/TREC 视频问答提交,在单张 3090 上实测了 8 款不同参数规模与架构的视频 VLM 的推理速度,涵盖两个任务:给定视频与查询返回十个排序答案、以及对候选答案按可能性排序。
结果以图表形式给出(正文含两张结果表与一张硬件/环境图)。作者强调几个口径注意点:
- TTFT 包含视觉编码器和服务端视频解码,不能与纯文本 LLM 的 prefill 直接对比;
- 并发为 1、非批处理推理;
- 吞吐与输出质量无关——有两个模型虽然跑得快,但产出的答案在最终提交中被拒用。
作者注明这不算严格 benchmark,只是 anecdotal 参考。
「Infra」频道最新
- 分析师:超大规模厂商 2026 折旧将达 2550 亿美元 — luisdans · 2026-09-19
- 为静音全程低功耗跑 M5 Max:128GB 本地跑 Qwen 的取舍实录 — joshwhiton · 2026-09-19
- 分析师称开源推理崛起令闭源 AI 基础设施承压,「推理者困境」显现 — AccBalanced · 2026-09-19
- 换 RTX4090 后 ComfyUI 离奇卡死,用户折腾两周仍未解决 — Jimbo_1995 · 2026-09-19
- 特斯拉 AI5 芯片在三星得州厂试产,2027 年量产在即 — XFreeze · 2026-09-19
- 数据中心耗水争议新论据:产一加仑牛奶耗水628加仑 — dfinke · 2026-09-19