观点:DeepSeek 应暂缓 4.1,专注后训练优化

bookwormengr · x · 2026-08-18

针对 DeepSeek 是否应开发 4.1 模型,作者持否定态度,认为应直接进行更大规模的预训练。评论指出 Moonshot 通过率先发布 3T 参数量级模型占据优势,目前可专注于该模型的后训练优化。同时观察到 GLM 系列通过后训练(从 5 到 5.3)仍有显著性能提升空间。

所属事件:观点:DeepSeek 应跳过 4.1 转向更大规模预训练(2 条相关)→

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →