Cerebras 推理速度接近 1400 tok/s

soumitrashukla9 · x · 2026-07-14

引用内容称,Cerebras 正在以接近 1,400 tok/s 的速度提供 GPT 5.6 Luna,而上下文里提到的 /fast 模式通常只有约 75 tok/s。

这条信息的重点不是模型能力本身,而是推理服务吞吐量的数量级提升,作者的态度是“用起来很魔法”,并表示已经非常期待。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →