Fireworks 分享 Jev 训练用法:GRPO 强化微调打分、离线筛 DPO 样本
sophiamyang · x · 2026-09-22
Fireworks AI 的 sophiamyang 介绍了在 Fireworks 训练管线中使用 Jev 的两种方式:
- 在线:对每个 prompt 采样 k 个 rollout,用 Jev 给每个打分,把其结构化(typed)答案映射为奖励信号,再做 GRPO 风格的强化微调(RFT)。
- 离线:用 Jev 给 DPO/ORPO 偏好对排序,或过滤 SFT 训练样本。
配套细节见 Fireworks 官方文档,该平台支持 100+ 开源模型的推理与最高 1T+ 参数的微调训练。
「编程与Agent」频道最新
- 开源多用户 Agent 平台 Nautilo 上线:Genie 可替你登录网站干活 — Dan_Jeffries1 · 2026-09-22
- 用 x402 让投研 Agent 订阅付费 Substack 财经通讯 — kleffew94 · 2026-09-22
- Hermes Agent 联手 ComfyUI 过夜自主迭代,做出角色替换视频 — Teknium · 2026-09-22
- 嫌 Codex 额度烧太快,开发者做 Token Saver 让 Muse 分担编码任务 — AIandDesign · 2026-09-22
- Agent 集群扩展 N 倍理论上可得 N^λ 倍加速 — tobyordoxford · 2026-09-22
- 睡一觉醒来:Agent 自作主张给训练任务加了 2 小时预算叫停 — BLUECOW009 · 2026-09-22