COLM 2026 论文 SwiLA:切换多个线性映射兼得表达力与固定状态
AccBalanced · x · 2026-10-06
作者 hyundongleee 介绍其入选 COLM 2026 的 Switching Linear Attention(SwiLA)论文。核心出发点:Softmax attention 表达力强,但 KV cache 随序列长度增长;线性注意力状态大小固定,却表达力不足。SwiLA 的做法是在多个线性映射之间动态切换,试图同时获得两者的优势——既保持固定状态大小,又提升表达能力。原帖为推文串开头,更多细节在原线程中。
「研究」频道最新
- 马志谦提议 arXiv 设终身百篇上限,马毅建议改为同时最多 10 篇 — YiMaTweets · 2026-10-06
- FlashDexRetarget:单个 RL 策略重定向人手演示,算力省约 100 倍 — KyleMorgenstein · 2026-10-06
- 斯坦福 ACE 团队推出 Sentry:失败知识常驻上下文反而拖累 Agent — StanfordAILab · 2026-10-06
- 从 Kaggle 冠军到 ULMFiT:Jeremy Howard 如何改写语言模型训练范式 — bigaiguy · 2026-10-06
- 在已后训练模型上再训练会「炸坏」模型:能力退化与 reality drift — Sauers_ · 2026-10-06
- PerturBot 用扰动训练打破视觉-语言-动作模型的捷径依赖 — Mingyu Liu · 2026-10-06