B300新FP4注意力核提速1.69倍

tuananh_org · reddit · 2026-07-14

有人分享了针对 B300 的一组新的 FP4 attention kernels,据称相较 FA4 最高可带来 1.69x 的速度提升。

这条信息本质上是在讲推理/算子层面的性能优化,而不是模型本身。若属实,说明围绕新硬件平台的 attention 实现仍有明显优化空间,尤其是在低精度路径上。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →