Fireworks 联手 HUD 推 RL 训练 Cookbook,一次定义任务即可训练+评估
sophiamyang · x · 2026-09-26
Fireworks AI 与 HUD 联合发布了一套强化学习训练 Cookbook,演示如何用 HUD 环境加 Fireworks Serverless Training API 训练 LoRA 适配器。
- 分工:HUD 负责运行 rollout,开发者在 HUD 中定义任务模板和程序化 grader;Fireworks 负责训练基础设施,把 rollout 结果转成训练数据并更新模型。
- 同一定义两用:同一个任务定义既可用于 RL 训练,也可用于 held-out 评估。
- 细节:每次 rollout 会从 HUD grader 获得 reward,并附带模型采样的精确 token ID 追踪,据此构造训练 datum。
- 示例:用四位数乘法任务在本地环境训练一个 Qwen 3.8 27B 的 LoRA 适配器——乘法只是占位,代表任何可用程序化判分验证的单轮能力。
「Infra」频道最新
- 训练与推理共享算力池但只单向流动:冲刺训练必然挤占线上服务容量 — robleclerc · 2026-09-26
- Tiger Data pg_textsearch 把原生 BM25 全文搜索带进 Google Cloud 托管 Postgres — michaelfreedman · 2026-09-26
- DuckDB-Wasm 借 OPFS 实现浏览器持久化,含版本踩坑指南 — JeremyCMorgan · 2026-09-26
- 高盛预测2030年Agent token用量增24倍,Uber微软已重估成本 — rohanpaul_ai · 2026-09-26
- Gordon Alexander:快速推理芯片可压缩评测周期赶在模型发版前测完长程任务 — gordic_aleksa · 2026-09-26
- Reddit 玩家用 3 台旧机器组多模型路由,想复刻 Claude Code 分工 — Shadow_s_Bane · 2026-09-26