前沿预训练或不再超 2 个月:拖 100 天等于浪费算法进步

scaling01 · x · 2026-09-07

有观点认为前沿模型单轮预训练最多约 2 个月:在 10 万张 GB200 上跑 100 天意义存疑,且长时间锁定训练意味着错过算法层面的快速进步,“浪费 100 天的算法进展”。作者以此推断 GPT-6 Astra 的 base case 也是短周期预训练。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →