Cerebras CTO 谈推理前沿:从 4000 走向每秒万 token
Latent Space · youtube · 2026-09-03
Latent Space 对话 Cerebras 联合创始人兼 CTO Sean Lie
- 速度即能力:Cerebras 认为 100–200 tokens/s 很快会像「批处理模式」一样过时;CS4 已把推理推到 4,400 tokens/s 以上,CS5 目标在中等规模模型上冲向 10,000 TPS,前沿模型可达约 5,000 TPS。
- 产能售罄:Cerebras 当前算力已基本卖光。
- OpenAI 合作:OpenAI 内部已用超快推理做事件响应与关键研究;Sean 解读 OpenAI 的 Jalapeño 芯片,认为 AI-first 芯片设计将改造半导体业,CS5 + Jalapeño 可能组合出新一代推理栈。
- 架构判断:他批评 Groq 的 SRAM 架构在前沿规模模型上的局限;认为围绕 NVIDIA GPU 设计的模型给替代架构留了大量性能空间,硬件-模型协同设计是下一个大增益来源。
- 推理分解:推理正在拆分为 prefill、decode、attention、专家路由等专门化负载;未来数据中心可能被设计成「一台巨型计算机」。内存带宽、3D 封装、功耗与散热正成为核心瓶颈。
- 中美竞争:中国开源模型崛起,且中国正形成日益独立的 AI 硬件生态。
「Infra」频道最新
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Jeff Dean 2007 年幻灯片流出:数据中心硬件故障实录 — SumitGup · 2026-09-03
- 谷歌 Hot Chips 发布第八代 TPU:一年两款芯片,推理训练分开设计 — firstadopter · 2026-09-03
- 数据中心耗水是迷思?现代机房多用闭路冷却,用水仅如写字楼 — GlenBradley · 2026-09-03
- 推理工程吃香:vLLM/SGLang 搭副本加缓存路由核心配方 — GabGarrett · 2026-09-03
- Databricks 在 VLDB 2026 主推 agent 原生数据基础设施 Lakebase — matei_zaharia · 2026-09-03