13 模型 probe 显示: token 速度预测不了真实任务耗时
According-Floor5177 · reddit · 2026-07-23
这条帖子认为,tokens/sec 不能预测模型完成一个真实任务的速度和成本。
- 作者引用了一次小规模 probe:13 个模型、每个 6 次运行,按墙钟时间而不是吐字速度统计。结果里,KAT-Coder 虽然 token 速度排第三,但因为总共用了 5,536 个 token,最终只排第十;而 GPT-5.5 只用了 1,777 个 token。
- 成本排序也和 token 速度不一致,说明“每秒输出多少 token”并不等于“做完任务更省钱”。
- 另外还有明显的提供商差异:Kimi K2.7 在 Together 上约 223 tok/s,在 DeepInfra 上只有 28 tok/s;GLM-5.2 则在 6 次运行里落到了 6 个不同 provider。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11