讨论哪些模型供应商能稳定跑到 150+ tok/s

DanielLockyer · x · 2026-08-04

这条讨论的核心是 模型/服务商组合的持续吞吐能力:有人指出,很多提供方会先把推理速度拉到 150+ tok/s 在 X 上宣传一波,过几天又悄悄降回 50 tok/s 左右。

原帖把“快模型”称作“有趣的模型”,本质是在问:到底有哪些模型/供应商能长期稳定提供高 token 速度,而不只是短期演示。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →