动态短卷积:改进 Transformer 表达能力的新方法

Cohere · youtube · 2026-08-15

Cohere Labs 分享了 MIT 博士生 Oliver Sieberling 关于“动态短卷积”的演讲。该方法将静态短卷积改为输入依赖的过滤器,使网络能自适应聚合局部上下文,从而提升 Transformer 语言模型的表达能力和性能。演讲还介绍了如何使用自定义 Triton 内核高效实现该算子。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →