观点:DeepSeek 应暂缓 4.1,专注后训练优化
bookwormengr · x · 2026-08-18
针对 DeepSeek 是否应开发 4.1 模型,作者持否定态度,认为应直接进行更大规模的预训练。评论指出 Moonshot 通过率先发布 3T 参数量级模型占据优势,目前可专注于该模型的后训练优化。同时观察到 GLM 系列通过后训练(从 5 到 5.3)仍有显著性能提升空间。
所属事件:观点:DeepSeek 应跳过 4.1 转向更大规模预训练(2 条相关)→
「公司和人」频道最新
- Lennart Heim 加入 OpenAI 基金会领导 AI 资源部门 — ohlennart · 2026-08-19
- Anthropic 招揽政策学者引发独立声音担忧 — peterwildeford · 2026-08-19
- AI 医疗创业 Prescience:让模型采取现实行动 — RishabJainK · 2026-08-19
- CoreWeave 宣布 2026 年 Fully Connected 大会 — wandb · 2026-08-19
- Prescience:首个将医学建模为游戏的 AI 系统 — RishabJainK · 2026-08-19
- ModCon 大会开幕:聚焦现代 AI 统一软件栈 — samcharrington · 2026-08-19