KAIST 推出 Thinking Reward Model:先定评分细则再审图,开源奖励模型登顶
Xuehai Bai · hf · 2026-09-30
KAIST 团队提出「先思考再打分」(Think Before You Score)范式与 Thinking Reward Model(TRM),改进视觉生成奖励模型。
核心思路
- 现有奖励模型直接把任务条件与候选输出映射为标量分,隐去了「该评什么」。TRM 先为每个 case 生成自适应评分细则(rubric),再按细则评估,输出细粒度逐点分数。
方法亮点
- 发现传统成对偏好优化会导致分数两极分化,提出 Pairwise Dual-Group Relative Policy Optimization(PD-GRPO),兼顾成对监督与细粒度打分。
结果
- 在图像生成与编辑的奖励建模基准上,TRM 达到开源奖励模型 SOTA,与闭源方案竞争力相当。
- 用 TRM 作 RL 奖励信号,可持续提升多种视觉生成模型,证明细粒度自适应奖励是有效优化信号。
「多模态」频道最新
- AutoRef 开源:面向智能体多参考图生成的 Harness 优化 — NunyaBuzor · 2026-09-30
- Claude Opus 5.5 还原《戴珍珠耳环的少女》创作瞬间,网友直呼动人 — justin_hart · 2026-09-30
- Reddit 用户用 AI 制作出科幻短片《Erebus-9: The Hiveborn Archives》 — himeonisama · 2026-09-30
- 让 Claude Opus 自己标注时间戳配音:实测人机协作解说视频工作流 — RileyRalmuto · 2026-09-30
- 阿里达摩院开源 WorldAttention:交互式视频世界模型高效注意力架构 — Alibaba-DAMO-Academy · 2026-09-30
- 新加坡国立大学 MaLiang-Harness:用可执行程序控制图像视频生成,并定义 P2V 差距 — NationalUniversityofSingapore · 2026-09-30