模型训练通常不到六个月,算力爬坡正改变排期方式
willdepue · x · 2026-07-29
训练跑批通常还不到 6 个月,原因是算力爬坡和研究节奏
这条帖子给出的判断是:现在还没有人连续训练一个模型超过 6 个月。
- 主要原因不是技术上做不到,而是 算力逐步爬坡 和 研究进展太快,让团队没必要过早把训练周期锁死。
- 作者的意思是,如果真的想要更多 GPU 小时,只要把 GPU 数量和训练时长一起扩 就行。
- 这反映出当前训练流程仍偏向 灵活迭代,而不是一次性押注超长周期。
「Infra」频道最新
- Dwarkesh 认为前沿模型变现会把 H100 租金推高许多倍 — inductionheads · 2026-07-29
- 有人问 373GB 模型能否靠 5070 Ti 16GB 显存跑起来 — Possible_Grocery8079 · 2026-07-29
- AI 供应链分析称,市场低估了结构性需求强度 — BenBajarin · 2026-07-29
- Mixedbread 推出 listwise reranker,新版称速度快 61 倍 — antoine_chaffin · 2026-07-29
- Turbopuffer 新增测试版 late interaction 向量检索 — antoine_chaffin · 2026-07-29
- 4 张 RTX 5060 Ti 跑 vLLM 的 NVFP4 修复与调参记录 — see_spot_ruminate · 2026-07-29