DeepSeek 回归 encoder-decoder 架构,新架构改动全面开源
evijit · x · 2026-09-10
DeepSeek 新模型采用 encoder-decoder 架构,做出架构层面的创新,并将相关技术信息公开开源。评论认为 DeepSeek 持续以架构级创新拉高整个 AI 研究生态的技术下限。
所属事件:DeepSeek 新模型回归 encoder-decoder 架构并开源(2 条相关)→
「模型」频道最新
- 实测:Google AI Mode 未登录用户引用来源三周内锐减 72% — gaganghotra_ · 2026-09-10
- DeepSeek 自曝 CED 架构灵感来自 2024 年 YoCo 论文 — jm_alexia · 2026-09-10
- DeepSeek 效率研究将成本压降超 10 倍,架构成降价唯一数学变量 — ChengleiSi · 2026-09-10
- DeepSeek 发布非对称新架构:552B MoE,输入仅激活 8B — ChengleiSi · 2026-09-10
- 13 步手推 Switch Transformer:看懂 MoE 为何省算力 — ProfTomYeh · 2026-09-10
- Gemini V4.1 预训练算力估算:约 5e24 FLOPs,4K 块 B300 两周可跑完 — teortaxesTex · 2026-09-10