260 万美元 RL 就近 SOTA:数据成本会否超过训练成本?
my_cat_can_code · x · 2026-09-21
mycatcancode 提出一个值得关注的行业问题:在模型训练中,数据成本是否可能超过训练本身的开销?
论据是 MiMo 仅用约 260 万美元的强化学习(RL)训练,就在 DeepSWE 基准上取得接近 SOTA 的成绩。这暗示随着 RL 运行成本快速下降,高质量数据的获取与使用成本可能成为新的瓶颈。
该观点引发对训练经济学结构性变化的讨论:算力在降价,数据在涨价。
「Infra」频道最新
- Reddit 实操讨论:生产环境如何测试 LLM 提供商故障 — Rama_Surasani_ · 2026-09-21
- 本地跑 Flux 2 Dev 全攻略:30B 模型配显存方案与模型组合玩法 — Altruistic_Heat_9531 · 2026-09-21
- 黄仁勋重申 AI 基础设施市场将达 3-4 万亿美元;Meta 遭生物识别诉讼 — emmanuelvivier · 2026-09-21
- 线上分享:用 d-Matrix 芯片做分解式投机解码与推理引擎调优 — cfregly · 2026-09-21
- Program-as-Weights:0.6B 模型本地性能媲美 32B 提示,内存仅 1/50 — yuntiandeng · 2026-09-21
- 个人 Agent 爆发成 NAND 闪存需求激增的最大推手 — zephyr_z9 · 2026-09-21