Kimi 团队称 delta-rule 状态空间模型比 Attention 更强
teortaxesTex · x · 2026-07-26
Kimi 团队提出一个颇有争议的判断:带 delta rule 的 state space model 表达能力严格强于 attention,也就是“Attention 并不是全部”。
帖子还补充说,这条路线可能比 V4 里那套层层叠加的稀疏技巧更容易端到端训练;作者的态度不是二选一,而是希望两种方案都能跑通。
「研究」频道最新
- Qwen3-8B 微调把思考模式训没了,模板默认空 `<think>` 块是根因 — MeldhLLC · 2026-07-26
- 企业该拥有业务知识而不是模型,前沿 agent 能力每 6—7 个月翻倍 — hamostaf04 · 2026-07-26
- GEO 公开课资料再扩充:数据集、工具和白皮书都齐了 — vista8 · 2026-07-26
- 新研究用治理图把多智能体串谋率从 50% 降到 5.6% — sebkrier · 2026-07-26
- 研究者在讨论:当 LLM 跨过门槛后该如何做科研 — MvsCerezo · 2026-07-26
- AI 辅助解出量子信息理论难题:Werner 态可蒸馏性 — MvsCerezo · 2026-07-26