Cerebras CS-4 实测:10T 参数模型推理速度超 1000 token/s

bookwormengr · x · 2026-08-19

Cerebras CTO Sean Lie 透露,下一代 CS-4 系统预计下季度 GA,凭借晶圆间通信低于 2 微秒的超低延迟,可支持 10T 参数模型以超过 1000 tokens/秒的速度进行推理。数据显示端到端延迟随规模上升缓慢,配合推测解码技术性能显著。

所属事件:Cerebras 发布 CS-4 晶圆级加速器,宣称推理快 30 倍(11 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →