AMD 联手 Cerebras 拆分推理:KV 缓存成跨芯片桥梁
TheTuringPost · x · 2026-08-02
AMD 与 Cerebras 正在构建一种新型 AI 基础设施,将大模型推理的 Prefill(预填充) 与 Decode(解码) 阶段拆分到不同的硬件架构上运行:
- AMD Helios 负责处理输入提示词,并行构建 KV 缓存。
- 随后系统将 KV 缓存和请求元数据转移至 Cerebras CS-3 晶圆级引擎。
- Cerebras CS-3 依托该缓存状态,以极高速度逐个生成输出 Token。
这种异构组合对用户完全透明,但数据中心的算力效率大幅提升。官方宣称该方案可将每瓦特的 Token 生成速度提升多达 5 倍。不过,跨系统传输 KV 缓存的延迟将成为这套架构最大的性能瓶颈。
「Infra」频道最新
- Tobi 开源 walgit:无数据库的单二进制 Git 服务器 — jevon · 2026-08-24
- s3collections:用S3构建分布式系统持久化数据结构 — andersonbcdefg · 2026-08-24
- 预测市场:年底前美一州实施数据中心禁令概率 68% — Polymarket · 2026-08-24
- Ramp 用本地模型省钱,引发业界对 AI 成本反思 — annetgriffin · 2026-08-24
- GitHub Actions 额度耗尽,是时候迁移到自建 VPS 了吗? — MicahBerkley · 2026-08-24
- Ubuntu 计划成为 RISC-V CPU 的参考操作系统 — bookwormengr · 2026-08-24