LMSYS 推出 AutoEval 实现大模型秒级评测
LMSYS(Arena 团队)正式宣布在排行榜中引入 AutoEval 机制,旨在解决真实人类投票收集耗时过长的问题。该系统基于海量真实用户偏好数据训练专用奖励模型(RM),能为新发布的大模型提供首日极速评测信号,并在积累足够人类投票后进行更新验证。
已确认
- 工作原理:AutoEval 利用数百万真实 Arena 用户偏好数据训练奖励模型,由 RM 自动生成代理投票,从而实现秒级评测。针对不同模态(如视觉、图像生成、代码等),团队训练了专用的奖励模型。
- 性能表现:在文生图任务中,使用了超过特定规模的偏好数据,其评测效果超越基线 9 分。
- 有效性验证:团队将 AutoEval 的早期排序与最终的实时排行榜进行了对比。结果显示,当两个模型的分数差距较大时,AutoEval 早期排序的准确率超过 90%。
为什么重要
AutoEval 大幅缩短了模型评测的周期,使得新模型在发布首日即可获得经过真实数据校准的高质量评估信号。这不仅提升了排行榜的更新效率,也为模型开发者在正式上线完整榜单前提供了可靠的候选检查点对比依据。
2026-07-31 ~ 2026-07-31 · 5 条相关
一手来源
- Arena 推出 AutoEval:基于奖励模型实现分钟级评测 — arena ·
- Arena 公开多模态奖励模型:文生图评测超基线 9 分 — arena ·
- Arena 验证 AutoEval:高分差下排序准确率超 90% — arena ·
- 【源头】Arena 验证 AutoEval:高分差下排序准确率超 90% — arena · 2026-07-31
- 【源头】Arena 推出 AutoEval:基于奖励模型实现分钟级评测 — arena · 2026-07-31
- 【源头】Arena 公开多模态奖励模型:文生图评测超基线 9 分 — arena · 2026-07-31
- LMSYS 推出 AutoEval:基于真实偏好秒级评测大模型 — vista8 · 2026-07-31
另有 1 条近重复转述:arena