Arena 公开多模态奖励模型:文生图评测超基线 9 分

arena · x · 2026-07-31

LMSYS(Arena 团队)分享了其在构建自动评测系统(AutoEval)方面的最新进展。该团队基于平台上的实时用户偏好数据,针对不同模态(视觉、图像生成、代码等)训练了专用的奖励模型。

例如,在文生图任务中,他们使用了超过 300 万对偏好数据来训练奖励模型。在公开的 MMRB2 基准测试中,该模型在逐点奖励模型中取得了 SOTA 表现,得分领先下一个最佳基线 9 分以上。

所属事件:LMSYS 推出 AutoEval 实现大模型秒级评测(5 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →