动态短卷积:改进 Transformer 表达能力的新方法
Cohere · youtube · 2026-08-15
Cohere Labs 分享了 MIT 博士生 Oliver Sieberling 关于“动态短卷积”的演讲。该方法将静态短卷积改为输入依赖的过滤器,使网络能自适应聚合局部上下文,从而提升 Transformer 语言模型的表达能力和性能。演讲还介绍了如何使用自定义 Triton 内核高效实现该算子。
「Infra」频道最新
- 前 Figma 设计高管:算力即主权 — soleio · 2026-08-15
- CEO亲自上手修复 sonic-moe 内核索引溢出Bug — rosstaylor90 · 2026-08-15
- 长文推理消耗惊人:2.2万 Token 仅生成 3千 字 — generativist · 2026-08-15
- NVIDIA 本地 AI 系统本周适配多款开源模型 — nvidia · 2026-08-15
- Q-CTRL 量子实测:材料模拟比经典求解器快 3000 倍 — MJBiercuk · 2026-08-15
- Nipe:将Tor设为默认网关的匿名路由引擎 — tom_doerr · 2026-08-15