腾讯发布 RewardVerse:Rubric 引导优化解决视频奖励标量漂移
tencent · hf · 2026-09-24
腾讯团队发布 RewardVerse,针对视频生成强化学习中奖励模型(RM)不稳定的「标量漂移」问题——现有视频奖励模型直接把复杂的视频质量映射成单一分数,跨 prompt 时打分尺度会塌缩或漂移,导致 RL 训练信号不可靠。
核心思路:
- 借鉴人工标注工程,引入动态 Rubric(评分细则)作为查询与打分器之间的中间表示:先生成显式评估标准,再按 rubric 打分,提供稳定的语义锚点;
- 提出 RGPO(Rubric-Guided Policy Optimization) 两阶段训练算法:先用自进化种子 rubric 预热打分器,再联合优化 rubric 生成器,使其产出适配具体查询的评估标准,同时持续对齐人类评分。
实验在 16 维 EvalVerse 基准及外部数据集上验证:缓解标量漂移,pointwise 与 pairwise 评估均达到 SOTA,为视频生成 RL 提供稳健且可解释的奖励信号。
「多模态」频道最新
- Reddit 用户实测 Qwen 2.1 角色 LoKr 训练:多分辨率是关键 — Any_Tea_3499 · 2026-09-24
- 开源 MCP 服务器打通 Claude 与 ComfyUI,50+ 工具免拖节点 — Less_Actuary_9441 · 2026-09-24
- 用对话把15秒粗糙演示打磨成30秒SpaceX概念片 — nikola_mr64990 · 2026-09-24
- Blender MCP 星标 2.9 万,Opus 5.5 中档力度即可建城 — sidahuj · 2026-09-24
- Fish Audio 发布 Drama 3 预览版:号称史上最可控 TTS 模型 — bdsqlsz · 2026-09-24
- 用 Veo 造「豚鼠学者」纪录片,五幕短剧口型同步惊艳 Reddit — No_Ruin_3716 · 2026-09-24