130 小时、750 亿 token、260 万美元,一次 RL 训练的真实账单
burny_tech · x · 2026-09-23
zephyrz9 分享了一个 RL 训练结果:团队投入 130 小时算力、750 亿 token、约 260 万美元的强化学习成本,才换来相应的性能提升。推文突出了前沿 RL 训练的昂贵程度——数百万美元级别的投入只覆盖一次训练,直观展示了强化学习 scaling 的真实开销。
所属事件:130 小时 RL 训练花 260 万美元,引发训练成本热议(2 条相关)→
「Infra」频道最新
- Cloudflare CTO 入选 TIME 年度高管:为 agent 时代重建互联网 — dinasaur_404 · 2026-09-23
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- optimAIzr:本地 CLI 找出 AI 用量浪费,支持 Claude Code 与 Codex 省钱 — stichstichstich · 2026-09-23
- 256GB 内存版 Mac Studio 二手溢价 6000 美元仍一机难求 — GabGarrett · 2026-09-23
- Ben Bajarin 解析 AI 数据中心:CPU 与内存如何限制 GPU 推理服务能力 — BenBajarin · 2026-09-23
- Epoch AI 报告:「思考」的价格正在暴跌,智能成本持续陡降 — Proper_Actuary2907 · 2026-09-23