前沿预训练或不再超 2 个月:拖 100 天等于浪费算法进步
scaling01 · x · 2026-09-07
有观点认为前沿模型单轮预训练最多约 2 个月:在 10 万张 GB200 上跑 100 天意义存疑,且长时间锁定训练意味着错过算法层面的快速进步,“浪费 100 天的算法进展”。作者以此推断 GPT-6 Astra 的 base case 也是短周期预训练。
「Infra」频道最新
- FP8/FP4 实际加速仅约 1.5x 与 2x,远低于理论值 — scaling01 · 2026-09-07
- 北方华创展示 64 层 3D DRAM 关键刻蚀工艺,绕开 EUV 延续密度扩展 — pstAsiatech · 2026-09-07
- 荷兰格罗宁根基于 Qwen 3.5 27B 微调建本土 AI,数据中心获补贴 — teortaxesTex · 2026-09-07
- 本周 AI 必读:OpenAI 研究加速报告与 Broadcom 167 亿 AI 芯片营收 — VibeMarketer_ · 2026-09-07
- 端侧Android agent实测:Gemma 4 E2B实时仅2.6 tok/s,回放却达11 — HowDevelop · 2026-09-07
- 开发者自写 Marlin 风格 FP4/FP8 内核,NVIDIA 拒绝合并 — QuixiAI · 2026-09-07