Flow-GRPO 接入真人投票打分,防图像模型钻奖励模型空子
lmoroney · x · 2026-10-07
- 微调图像模型时,PickScore、ImageReward 这类习得式奖励模型会随模型输出分布漂移,训练容易学会「钻空子」刷分而非真正符合人类审美。
- Rapidata 在 Hugging Face 发文,提出把真人实时投票直接接入 Flow-GRPO 训练循环:每个 prompt 生成一组图像,人类成对比较后用 Bradley-Terry 拟合得到分数,分数作为组内相对优势用于策略更新。
- 按其原始 Flow-GRPO 配置(每步 48 组、每组 24 张、每组 100-150 人响应、3 分钟截止),估算约需每分钟 2400 次人工响应。作者提醒这是其自家产品的宣传口径,速度数据待独立验证。
「多模态」频道最新
- HeyGen 视频模型升级 2K 分辨率:OpenRouter 用量榜第一 — aftahi_ai · 2026-10-07
- AI 制作动画长片《Gods Don't Give Gifts》将冲击奥斯卡 — lmoroney · 2026-10-07
- 用 Seedance+Opus 5.5+Suno 做出 AI 圈剧情 MV,对口型最难搞 — repligate · 2026-10-07
- 语音 Agent 的关键在「听起来对」:Turbo 会随用户情绪切换语气 — SucceededMind · 2026-10-07
- Magnific 原创剧集《The Chronicles of Bone》第六集上线,全程 AI 制作 — Kavanthekid · 2026-10-07
- Hedra 上架 ChatGPT 插件:传一张产品图即可生成完整商业广告 — henloitsjoyce · 2026-10-07