Cerebras CEO 揭秘:晶圆级架构推理为何比 GPU 快 2500 倍
rohanpaul_ai · x · 2026-10-03
Cerebras 联合创始人兼 CEO Andrew Feldman 在 The MAD Podcast 上解释了公司晶圆级架构在 LLM 推理时比 GPU 快 2500 倍的原因:
- 推理分两阶段:pre-fill(处理用户 prompt)和 decode(逐 token 顺序生成答案)。
- Decode 阶段的瓶颈:每生成一个 token 前,模型权重都要从内存搬运到计算单元。
- 关键差异:GPU 上权重存放在 HBM,而 Cerebras 把权重放在分布在超大晶圆级处理器上的 SRAM 中——SRAM 远快于 HBM,使得逐 token 必需的「内存→计算」搬运快约 2500 倍。
完整视频见 The MAD Podcast with Matt Turck 频道。
「Infra」频道最新
- 双 RTX 3090 本地跑 256k 上下文模型,实战数月后求升级建议 — knighty1981 · 2026-10-03
- Prime Intellect 用 NVFP4 压缩 MLA KV 缓存,可多缓存约 50% token — TheZachMueller · 2026-10-03
- Runware 推出 Serverless GPU:空闲 $0,低至 $0.63/GPU 小时 — aziz4ai · 2026-10-03
- 布科夫:生成式AI只有卖GPU的在赚钱,重演互联网泡沫 — burkov · 2026-10-03
- 从抽象表示直接推导 KV-cache 位置,prefill 与推理形式可互通 — vtabbott_ · 2026-10-03
- 黄仁勋早已不止卖 GPU:NVIDIA 从 CUDA 一路铺到物理 AI — sudoraohacker · 2026-10-03