讨论哪些模型供应商能稳定跑到 150+ tok/s
DanielLockyer · x · 2026-08-04
这条讨论的核心是 模型/服务商组合的持续吞吐能力:有人指出,很多提供方会先把推理速度拉到 150+ tok/s 在 X 上宣传一波,过几天又悄悄降回 50 tok/s 左右。
原帖把“快模型”称作“有趣的模型”,本质是在问:到底有哪些模型/供应商能长期稳定提供高 token 速度,而不只是短期演示。
「Infra」频道最新
- Meta 的 GRACE 把广告生成解码延迟降了 11 倍 — _reachsumit · 2026-08-04
- SemiAnalysis:AWS 到 Meta 都转向模块化数据中心 — bookwormengr · 2026-08-04
- 面壁智能开源 ForgeStencil,一周优化百个 HPC 应用 — 面壁智能 · 2026-08-04
- SGLang 创始人离开 xAI 后转向 RadixArk — hsu_byron · 2026-08-04
- 一条 token 粗算认为 15T 日流量可能不到两座 SuperPod — teortaxesTex · 2026-08-04
- 多智能体系统可能把笔记本内存和 CPU 吃满 — zephyr_z9 · 2026-08-04