网友复盘 DeepSeek V4.1 架构:若用非因果编码器或可成更强推理器
mgostIH · x · 2026-09-11
开发者 mgostIH 提出一个架构层面的「事后诸葛」观点:DeepSeek V4.1 的架构本可以采用非因果编码器加解码器的组合,但实际选择了编码与解码均为因果的设计。他认为前一种方案很可能训练出更强的推理器,且完整目标可以只对解码出的 token 做训练,仍保持因果性。此为个人推测,非官方信息。
「模型」频道最新
- V4.1在LiveBench排第5,Agentic Coding登顶但被指语言偏科 — teortaxesTex · 2026-09-11
- OpenAI 发布 GPT-Live 提示词指南:照搬旧提示词难以发挥 SOTA — craigsdennis · 2026-09-11
- 用户吐槽 GPT-6 Astra 一周额度一次用光,周一前无法继续干活 — max_paperclips · 2026-09-11
- Wiz发布Cyber Model Arena:Gemini 3.8 Flash Cyber以74.9%居首 — rseroter · 2026-09-11
- Anthropic 宣布 Claude 不再向未成年人开放 — petrusenko_max · 2026-09-11
- V4.1 冲上 LiveBench 第五:Agentic Coding 登顶,比 Astra 高 20 分 — teortaxesTex · 2026-09-11