AI推理分化:Prefill看算力,Decode看带宽
围绕推理硬件设计的讨论认为,AI 推理在 prefill 与 decode 阶段的瓶颈并不相同:前者主要受算力限制,后者尤其在 MoE 架构下更受带宽约束,因此强互连配合分布式 SRAM 的方案,可能带来更优的推理性价比。
2026-07-12 ~ 2026-07-12 · 2 条相关
- MoE 解码的带宽瓶颈与硬件选择 — AccBalanced · 2026-07-12
- AI 推理的两种瓶颈 — rohanpaul_ai · 2026-07-12