强化学习训练成本基准上线,高级 RL 费用首次有参照
teortaxesTex · x · 2026-09-17
nrehiew 发布了一个信息量很大的 dashboard,可系统查看各家模型的 RL 训练成本数据;teortaxesTex 评价这为高级 RL(强化学习后训练)的成本建立了基准参照,此前这一环节的费用几乎无公开数据。对关注训练成本与 scaling 的人是难得的一手数据源。
「Infra」频道最新
- 隐私 LLM 服务 Venice 日处理 token 量达 2500 亿,三月翻 2.5 倍 — 0xAllen_ · 2026-09-17
- Baseten 推出 Hosted Tools:开源模型首次获服务端实时联网搜索 — baseten · 2026-09-17
- 开发者提议 Claude Code 应做预测性动态上下文缓存 — Sauers_ · 2026-09-17
- Starlink 拉美农村联网大扩张:洪都拉斯万台天线连 8000 所学校 — NicoVerderosa · 2026-09-17
- 一次大规模推理跑了多少钱?Fable 显示每秒烧掉 1050 美元 — Sauers_ · 2026-09-17
- 一次大规模推理跑每秒烧 1050 美元,作者直呼心疼 — Sauers_ · 2026-09-17