Cerebras与Blackwell商用AFD架构
针对长上下文中注意力机制占据主导地位的问题,Cerebras与Nvidia Blackwell结合的AFD(Attention FFN Disaggregation)架构已投入商用。该架构通过硬件分工独立扩展注意力机制和FFN,显著提升了3T参数模型的推理速度,最高可达14倍。部署该3T模型需68个芯片与1.5MW功耗。作者推测,未来系统将更激进地采用上下文压缩技术,并在注意力侧增加更多Blackwell芯片以优化性能。
2026-08-14 ~ 2026-08-14 · 2 条相关
- Cerebras与Blackwell打造商用AFD架构,3T参数模型推理提速14倍 — teortaxesTex · 2026-08-14
- Cerebras部署3T模型需68芯片与1.5MW功耗 — zephyr_z9 · 2026-08-14