腾讯发布 RewardVerse:Rubric 引导优化解决视频奖励标量漂移

tencent · hf · 2026-09-24

腾讯团队发布 RewardVerse,针对视频生成强化学习中奖励模型(RM)不稳定的「标量漂移」问题——现有视频奖励模型直接把复杂的视频质量映射成单一分数,跨 prompt 时打分尺度会塌缩或漂移,导致 RL 训练信号不可靠。

核心思路:

实验在 16 维 EvalVerse 基准及外部数据集上验证:缓解标量漂移,pointwise 与 pairwise 评估均达到 SOTA,为视频生成 RL 提供稳健且可解释的奖励信号。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →