260 万美元 RL 就近 SOTA:数据成本会否超过训练成本?

my_cat_can_code · x · 2026-09-21

mycatcancode 提出一个值得关注的行业问题:在模型训练中,数据成本是否可能超过训练本身的开销?

论据是 MiMo 仅用约 260 万美元的强化学习(RL)训练,就在 DeepSWE 基准上取得接近 SOTA 的成绩。这暗示随着 RL 运行成本快速下降,高质量数据的获取与使用成本可能成为新的瓶颈。

该观点引发对训练经济学结构性变化的讨论:算力在降价,数据在涨价。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →