用 Jev 做奖励模型跑 RL,24 步把 AI 味奖励从 0.58 提到 0.76
sophiamyang · x · 2026-09-24
sophiamyang 发布教程文章,演示如何在 Fireworks 上用强化学习微调 Qwen3.8 27B,以新模型 Jev 作为奖励模型来减少「AI slop」(AI 味文本)。
要点:
- 经过 24 次更新,平均 Jev 奖励从 0.583 升至 0.759,说明输出质量有改善
- Jev 大幅降低 RL 训练的成本与时延:896 次调用仅花 0.061 美元,中位延迟 186ms
- 作者称 Fireworks 让 RL 训练流程简单易上手,并附完整代码教程
这是一个入门级玩具示例,但展示了「用模型当奖励模型」做 RL 的可复现流程。
「编程与Agent」频道最新
- 26 个 Opus 5.5 智能体一夜造出多层世界多人游戏,发布 30 分钟被挤爆 — TAbrodi · 2026-09-24
- Claude Code 云端会话正式上线,Pro/Max 用户获 $100/$250 试用金 — jarrodwatts · 2026-09-24
- 有人创下单次 Claude 运行最贵纪录,Shumer 直言「不敢说花了多少」 — mattshumer_ · 2026-09-24
- Hermes Desktop 推出 Bot Screen:实时观看智能体操作并随时接管 — NousResearch · 2026-09-24
- Hermes Bot Screen 实战文档:网关托管桌面+人工接管的工作方式与威胁模型 — NousResearch · 2026-09-24
- SWE-Together 榜单审计:111 次试验绕过拦截,Grok 4.7 重跑后排名上升 — elonmusk · 2026-09-24