13 模型 probe 显示: token 速度预测不了真实任务耗时
According-Floor5177 · reddit · 2026-07-23
这条帖子认为,tokens/sec 不能预测模型完成一个真实任务的速度和成本。
- 作者引用了一次小规模 probe:13 个模型、每个 6 次运行,按墙钟时间而不是吐字速度统计。结果里,KAT-Coder 虽然 token 速度排第三,但因为总共用了 5,536 个 token,最终只排第十;而 GPT-5.5 只用了 1,777 个 token。
- 成本排序也和 token 速度不一致,说明“每秒输出多少 token”并不等于“做完任务更省钱”。
- 另外还有明显的提供商差异:Kimi K2.7 在 Together 上约 223 tok/s,在 DeepInfra 上只有 28 tok/s;GLM-5.2 则在 6 次运行里落到了 6 个不同 provider。
「Infra」频道最新
- CrowdStrike 选 Cerebras 加速 Falcon AIDR 安全推理 — Sethwinterroth · 2026-07-23
- 微软深化 Genesis Mission 合作,追加 AI 科研基础设施投入 — satyanadella · 2026-07-23
- Serverless Framework 给 Agent 代码加了 Lambda microVM 沙箱 — DavidWells · 2026-07-23
- Proprio Robotics 要用机器人重构自治数据中心运维 — ycombinator · 2026-07-23
- AMD Advancing AI 大会:展示 MI355X 运行大规模 MoE 模型 — ying11231 · 2026-07-23
- 韩国6月NAND闪存出口暴涨300%,AI推理算力需求正全面外溢 — tengyanAI · 2026-07-23