AMD 联手 Cerebras 拆分推理:KV 缓存成跨芯片桥梁

TheTuringPost · x · 2026-08-02

AMD 与 Cerebras 正在构建一种新型 AI 基础设施,将大模型推理的 Prefill(预填充) 与 Decode(解码) 阶段拆分到不同的硬件架构上运行:

这种异构组合对用户完全透明,但数据中心的算力效率大幅提升。官方宣称该方案可将每瓦特的 Token 生成速度提升多达 5 倍。不过,跨系统传输 KV 缓存的延迟将成为这套架构最大的性能瓶颈。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →