Arena推出AutoEval:基于奖励模型实现模型首日极速评测
arena · x · 2026-07-31
Arena 官方宣布在排行榜中引入 AutoEval 评分系统,以解决真实人类投票收集耗时过长的问题。AutoEval 旨在为新发布的模型提供“首日(Day-1)”评测信号,并在积累足够人类投票后进行更新验证。
工作原理:Arena 团队利用其大规模的人类偏好数据集(包含数百万次实时投票的两两对比)训练了一个奖励模型(RM)。该模型能自动对单个提示-回复对进行打分,从而模拟人类判断并自动投票。
核心优势:
- 极速反馈:基于 RM 的投票可在不到一小时内生成排名。
- 高灵活性:可通过定制提示针对特定领域进行评测。
- 多模态支持:AutoEval 横跨文本、视觉、图像生成和编码等多个领域,在人类投票无法快速扩展的环节提供自动化补充。
所属事件:LMSYS 推出 AutoEval 实现大模型秒级评测(5 条相关)→
「模型」频道最新
- Transluce发布WeirdChat,收录17万条大模型异常行为 — ChowdhuryNeil · 2026-07-31
- 图表揭示大模型性价比飞跃:极低成本即可获高智能 — downingARK · 2026-07-31
- AI 太空竞赛实测:GPT-5.6 得分 13% 创纪录,Kimi K3 仅 5.2% — scaling01 · 2026-07-31
- 曝 OpenAI GPT-5.6 实现自我优化:服务成本降 20% — tszzl · 2026-07-31
- 学者激辩 Scaling Law:模型变强但泛化变差? — davidmanheim · 2026-07-31
- Neutrino-8B 上榜 HF,采用低于 2-bit 的三值量化 — FermionResearch · 2026-07-31