130 小时、750 亿 token、260 万美元,一次 RL 训练的真实账单

burny_tech · x · 2026-09-23

zephyrz9 分享了一个 RL 训练结果:团队投入 130 小时算力、750 亿 token、约 260 万美元的强化学习成本,才换来相应的性能提升。推文突出了前沿 RL 训练的昂贵程度——数百万美元级别的投入只覆盖一次训练,直观展示了强化学习 scaling 的真实开销。

所属事件:130 小时 RL 训练花 260 万美元,引发训练成本热议(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →