Cerebras与Blackwell商用AFD架构

针对长上下文中注意力机制占据主导地位的问题,Cerebras与Nvidia Blackwell结合的AFD(Attention FFN Disaggregation)架构已投入商用。该架构通过硬件分工独立扩展注意力机制和FFN,显著提升了3T参数模型的推理速度,最高可达14倍。部署该3T模型需68个芯片与1.5MW功耗。作者推测,未来系统将更激进地采用上下文压缩技术,并在注意力侧增加更多Blackwell芯片以优化性能。

2026-08-14 ~ 2026-08-14 · 2 条相关