Kimi K3 论文透露混合注意力与自研 Kimi Linear
peterjliu · x · 2026-07-28
Kimi K3 可能采用了混合注意力和自研 Kimi Linear
这条帖子根据 Kimi K3 论文指出:模型似乎采用了混合的线性注意力 / 全注意力设计,并且使用了自家的 Kimi Linear 变体,作者提到其宣称表现优于全注意力。
帖子认为,这可能是首个被确认采用混合注意力的前沿模型;同时也强调,这类做法在主线前沿模型里非常少见,因为它明显偏离了传统 Transformer 路线。作者还提到,论文里似乎直接去掉了位置编码/位置嵌入。
整体上,这被解读为 Moonshot 对小规模扩展结果有很强信心,才敢把这种架构创新放进主模型。
所属事件:Kimi K3 架构深度解析:2.8T参数与注意力机制革新(16 条相关)→
「模型」频道最新
- 老 Web 开发者称 Claude Opus 4.8 和 5 聊天已难用 — FuzzyHead455 · 2026-07-29
- 用户称 Gemini Pro 付费后仍被分流到其他模型 — IAmMonke2 · 2026-07-29
- 一组假 Claude 截图把“模型福利”写成了 AI 圈名场面 — repligate · 2026-07-29
- ChatGPT 安卓版疑似把模型切换改成 effort 等级 — justanothergin · 2026-07-29
- 伪造 Claude 截图变成超立方体纠错梗图 — repligate · 2026-07-29
- ChatGPT Plus 用户称出现随机每周用量重置 — Glxblt76 · 2026-07-29