Qwen、Kimi、GLM 已弃用全注意力,8 种注意力设计详解
julsimon · x · 2026-10-11
AWS 开发者倡导者 Julien Simon 发布新视频,指出主流开源 LLM 的注意力机制正在悄然换血。
- Qwen(阿里)、Kimi(月之暗面)与 GLM(智谱)已在多数甚至全部层里用更省钱的注意力变体替代了全注意力,打开各自 config 文件即可验证。
- 核心问题:这些新设计几乎没人在长任务、大规模、有深度场景下与全注意力做过严格对比——省下的算力是可测的,质量证据却很薄弱。
- 视频覆盖 8 种注意力设计、谁真正做过测试,以及在你基于某种设计构建之前的 6 项检查清单;幻灯片与动画以 CC BY 4.0 开放分享。
「模型」频道最新
- 推荐系统圈调侃数据重复放大过拟合:所以我们只训一个 epoch — thomasahle · 2026-10-11
- 为什么你爱听新观点?LLM 的「引用奖励」机制暗合人性 — sanderssays · 2026-10-11
- 微软宣称 80ms 的决策模型实测 300ms,输给开源对手 — DotaMate · 2026-10-11
- 数据称 Meta Muse 增长放缓:日增活跃用户较九月骤降 62.4% — AccBalanced · 2026-10-11
- 研究者质疑 OpenAI 利用用户 prompt 训练,点名陶哲轩上榜 — basedjensen · 2026-10-11
- 工程师驳 engram 数据重复过拟合新论:只是普通过拟合 — teortaxesTex · 2026-10-11