观察:v4 训练无失稳,1M 上下文撑约 10T token 训练量
stochasticchasm · x · 2026-09-11
- 训练全程未出现失稳,作者推测 v4 训练期的稳定性问题已在新一轮训练中解决,对这个架构是积极信号。
- 值得注意的是对方继续沿用 WSD 学习率调度,并在约 10T token 的超长训练中做上下文长度扩展。
- 作者感叹:以 1M token 的上下文长度持续训练这么久相当激进罕见。
所属事件:DeepSeek V4 训练细节:超 10T token 与 1M 上下文(3 条相关)→
「Infra」频道最新
- Google 宣布在芬兰投资 150 亿美元建设 AI 基础设施 — LinkedInNews · 2026-09-11
- DeepSeek-V4.1-Flash 登陆 Ollama:763B MoE、1M 上下文,主打 KV cache 压缩 — ollama · 2026-09-11
- 作者自制 KiCad 封装库,让 AI 芯片 DIY 原型板更好布线 — debreuil · 2026-09-11
- 从业者爆料:LLM 推理服务商毛利极薄,月营收1万美元仅赚200美元 — metalvendetta · 2026-09-11
- kimi k3 或采用同置异步 RL,v4 批次不变性设计引猜测 — stochasticchasm · 2026-09-11
- Peter Diamandis:AI 竞赛正变成我们这代最大的基建工程 — PeterDiamandis · 2026-09-11