Arena 推出 AutoEval:基于奖励模型实现分钟级评测
arena · x · 2026-07-31
Arena 官方博客宣布在排行榜中引入 AutoEval 机制,以解决真实人类投票收集耗时过长的问题。
- 工作原理:通过在 Arena 海量人类偏好数据上训练奖励模型(RM),由 RM 自动生成代理投票。结合真实人类投票后,能在不到一小时内给出模型排名。
- 多模态支持:该机制不仅限于文本,还扩展至视觉、图像生成和代码领域。例如,其文生图奖励模型基于超 300 万对偏好数据训练,在公开基准 MMRB2 上取得 SOTA 表现。
- 动态更新:AutoEval 分数会在新模型发布首日提供早期信号,待积累足够人类真实投票后再进行验证和更新。
所属事件:LMSYS 推出 AutoEval 实现大模型秒级评测(5 条相关)→
「模型」频道最新
- 大模型推理成本骤降:4个月Token价格缩水至十三分之一 — charliermarsh · 2026-07-31
- 276B参数MoE模型可跑单卡,vLLM作者赞Inkling-Small — woosuk_k · 2026-07-31
- Google发布Gemini Robotics 2,实现人形机器人全身控制 — DynamicWebPaige · 2026-07-31
- Inkling-Small发布:以1/4参数量媲美原版性能 — arshdeep · 2026-07-31
- vLLM 发布 Inkling-Small 部署指南:最低180GB显存可跑 — vllm_project · 2026-07-31
- OpenAI 回应基准测试质疑:GDPval 趋于饱和 — emollick · 2026-07-31