LMSYS 推出 AutoEval:基于真实偏好秒级评测大模型
vista8 · x · 2026-07-31
LMSYS 官方宣布推出 AutoEval,这是一种全新的模型评估方法。该方法利用基于数百万真实 Arena 用户偏好数据训练的奖励模型,来对各类大模型进行排名。
核心亮点:
- 提供经过真实偏好数据校准的高质量评估信号。
- 评估结果与实时人类评估高度一致。
- 评估速度提升数个数量级(从数天缩短至数小时)。
- 全面支持文本、视觉、图像和代码竞技场。
官方表示,AutoEval 将大大加快新发布模型的评估速度,并会直接在排行榜上展示新模型的 AutoEval 预估分数。
所属事件:LMSYS 推出 AutoEval 实现大模型秒级评测(5 条相关)→
「模型」频道最新
- Transluce发布WeirdChat,收录17万条大模型异常行为 — ChowdhuryNeil · 2026-07-31
- 图表揭示大模型性价比飞跃:极低成本即可获高智能 — downingARK · 2026-07-31
- AI 太空竞赛实测:GPT-5.6 得分 13% 创纪录,Kimi K3 仅 5.2% — scaling01 · 2026-07-31
- 曝 OpenAI GPT-5.6 实现自我优化:服务成本降 20% — tszzl · 2026-07-31
- 学者激辩 Scaling Law:模型变强但泛化变差? — davidmanheim · 2026-07-31
- Neutrino-8B 上榜 HF,采用低于 2-bit 的三值量化 — FermionResearch · 2026-07-31