LMSYS Arena推出AutoEval自动化评测模型
arena · x · 2026-08-13
LMSYS Arena宣布推出AutoEval,这是一个基于数千万场人类历史真实对战数据训练而成的奖励模型。
与传统的LLM-as-judge(大模型做裁判)方法不同,AutoEval保持了一个动态的活基准,它直接从真实世界的提示词和模型回复中进行打分,能够以前沿速度估算人类偏好并交付评测结果。
「模型」频道最新
- 英伟达发布 Nemotron 3.5 Lightning 模型 — NVIDIAAI · 2026-08-13
- AI安全研究员吐槽:大厂首发模型卡常现低级拼写错误 — Miles_Brundage · 2026-08-13
- 曝 Ilya 转向扩展定律:SSI 打造小模型媲美大训练轮 — draecomino · 2026-08-13
- SemiAnalysis 炮轰英伟达:委员会式研发做不出前沿模型 — teortaxesTex · 2026-08-13
- 马斯克暗示 Grok 4.6 将至,称其实现帕累托最优 — shaunmmaguire · 2026-08-13
- LlamaIndex 发布 ExtractBench:专测企业复杂文档提取 — llama_index · 2026-08-13