DeepSeek 不断上移二次方分量,被赞是「苦涩教训」式科学探索

teortaxesTex · x · 2026-09-16

推主 teortaxesTex 评论 DeepSeek 的架构研究路线:他们把注意力中二次方计算的部分不断上移,压缩到更精炼的操作里。这不是工程师的小修小补,而是坦然接受「苦涩教训」——在自身科学框架内寻找全局计算的不可约最小原语。对于为何忽视线性注意力,他认为 DeepSeek 并非不知道(他们读过 Kimi 等论文、也采用了 Muon 优化器),而是线性注意力与其「定位全局计算最小充分原语」的系统性研究项目相冲突。

所属事件:DeepSeek V4.1 Flash 架构重置,KV缓存缩至四分之一(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →