Opinion: DeepSeek Should Skip 4.1 and Go Bigger on Pretraining

Commentators argue DeepSeek should not spend effort on version 4.1 but instead pursue larger-scale pretraining, citing Moonshot's early 3T-parameter model as giving it an edge.

2026-08-18 ~ 2026-08-18 · 2 related posts