Cognition 总裁:Cerebras 芯片跑自家模型达 950 tokens/s,快得让团队困惑

Sethwinterroth · x · 2026-08-05

Cognition 总裁 Russell Kaplan 在访谈中透露,他们部署的 Cerebras 芯片运行自家模型时速度高达约 950 tokens/s,远超同尺寸模型在 GPU 上的速度,快得让团队一度对测试结果感到困惑。他表示,Cerebras 在价格和吞吐量的帕累托曲线上占据独特位置,虽然服务成本略高,但使他们得以交付原本不可能实现的产品体验。

OpenAI 研究员 Jeffrey Wang 也证实,OpenAI 内部有模型运行在 Cerebras 芯片上,推理速度极快,任务在切换上下文之前就已完成,大幅提升了生产力。他认为延迟是各类部署的主要瓶颈之一,对超低延迟推理的前景感到兴奋。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →