DeepSeek 不断上移二次方分量,被赞是「苦涩教训」式科学探索
teortaxesTex · x · 2026-09-16
推主 teortaxesTex 评论 DeepSeek 的架构研究路线:他们把注意力中二次方计算的部分不断上移,压缩到更精炼的操作里。这不是工程师的小修小补,而是坦然接受「苦涩教训」——在自身科学框架内寻找全局计算的不可约最小原语。对于为何忽视线性注意力,他认为 DeepSeek 并非不知道(他们读过 Kimi 等论文、也采用了 Muon 优化器),而是线性注意力与其「定位全局计算最小充分原语」的系统性研究项目相冲突。
所属事件:DeepSeek V4.1 Flash 架构重置,KV缓存缩至四分之一(2 条相关)→
「模型」频道最新
- 爆料称「大发布周」临近,GPT-6 Sol 及系列小模型或在酝酿 — Winter-Mix-5155 · 2026-09-16
- TypeSafe AI 发布「系统一模型」Jev:面向代码的低延迟决策引擎 — bfrench · 2026-09-16
- 爆火新模型 Jev 不是聊天 LLM,专出概率答案又快又便宜 — rkulidzan · 2026-09-16
- Altman:GPT 5.5 相当于普通数学教授,内部模型超越全球顶尖数学家 — acoolrandomusername · 2026-09-16
- ChatGPT 桌面端翻车:强制展示已归档/已删除会话 — ___Patrice___ · 2026-09-16
- closed labs 加码生命科学数据,GPT-Rosalind 成 OpenAI 新多头论据 — xeophon · 2026-09-16