MoonshotAI 的 FlashKDA 提交暗示主线模型用了混合注意力
peterjliu · x · 2026-07-29
MoonshotAI 的 FlashKDA 提交暴露了混合注意力实现
MoonshotAI 的 FlashKDA 仓库里有一次 GitHub 提交,修复了 TMA 访问周围缺失的 proxy fence,同时也让外界看到了其自定义 attention 栈的一些线索。
这条帖里提到的关键信息
- 该仓库为新的 attention 实现写了自定义 CUDA kernel。
- 代码看起来采用了线性注意力 + 全注意力的混合设计。
- 文中还提到 Moonshot 自己的变体 Kimi Linear,并声称它比 full attention 更好。
- 提交信息里还能看到 Claude Fable 参与了 co-author。
为什么值得关注
讨论者认为,这可能是前沿模型首次被公开确认在主线模型里使用 hybrid attention。若属实,这意味着团队对小规模 scaling 结果有相当强的信心。
「编程与Agent」频道最新
- Codex Desktop 线程内自动化必须置顶才会运行 — carlosdponx · 2026-07-29
- Poolside 推出 macOS 桌面助手运行编码 Agent — nathanbenaich · 2026-07-29
- 合并冲突往往是团队流程问题,不是 Git 的问题 — rseroter · 2026-07-29
- llama.cpp维护者长文反思:用好AI编程不依赖前沿模型 — ngxson · 2026-07-29
- 作者说,5B active 模型该看工具调用,不该看知识背诵 — AcanthisittaOk1699 · 2026-07-29
- AWS实战:用LangGraph与Strands构建多智能体 — AWS ML Blog · 2026-07-29