预训练之后才是真正难点
teortaxesTex · x · 2026-07-14
作者认为,GPU 充足的实验室往往不会只做一次预训练,而是会并行跑多个相近的训练任务,再把表现最好的结果推进到后训练和生产环境。 他进一步指出:中国产业界在这种流程下处境更“不能出错”,因为他们面对的是另一套约束;同时也质疑“10T 级别预训练”本身是否被高估,真正困难的是发现一套达到 Anthropic 水平的训练配方需要多少计算与试验成本。
所属事件:预训练算力非绝对壁垒,后训练才是真正挑战(2 条相关)→
「模型」频道最新
- Bindu Reddy 称 Kimi 开源权重太慢,难以规模化使用 — bindureddy · 2026-07-21
- Qwen 3.8 Max 与 Kimi K3 领衔,OpenAI 长程失配引关注 — Latent Space · 2026-07-21
- Kimi K3 Max 在 sketch-to-3D 上胜过 Qwen 3.8 Max preview — OfirPress · 2026-07-21
- Kimi 团队与算力轶事外加一份民间模型榜单 — vista8 · 2026-07-21
- DavidAU 协作版据称提升了 Qwen 3.6 27B 的长上下文 Agent 表现 — My_Unbiased_Opinion · 2026-07-21
- 小语言模型更简短,大模型会把物理过程讲完整 — NickPassig · 2026-07-21