AI推理分化:Prefill看算力,Decode看带宽

围绕推理硬件设计的讨论认为,AI 推理在 prefill 与 decode 阶段的瓶颈并不相同:前者主要受算力限制,后者尤其在 MoE 架构下更受带宽约束,因此强互连配合分布式 SRAM 的方案,可能带来更优的推理性价比。

2026-07-12 ~ 2026-07-12 · 2 条相关