Agent Arena 弃用偏好投票,用真实会话五信号因果追踪评测智能体
arena · x · 2026-10-10
Arena.ai 介绍其 Agent Arena 排行榜的方法论:不用成对偏好投票,而是对真实用户长时程 agent 会话做因果追踪,提取五类信号给模型打分。
- Confirmed Success:弹窗显式询问用户「任务完成了吗」,只有明确点「是」才计分;礼貌性夸奖、中途放弃或不再回复均不计
- Praise vs Complaint:对引发用户明确情绪的每一轮标注表扬或抱怨
- 信号逐轮/逐任务评分后聚合为模型级分数,全部来自真实工作痕迹而非合成 benchmark
这是智能体评测从静态基准转向真实使用信号的一个代表性尝试。
所属事件:Agent Arena 改用因果追踪五信号评测,弃成对偏好投票(4 条相关)→
「模型」频道最新
- repligate:被列入模型罪状集恰说明模型已足够守规矩 — repligate · 2026-10-10
- 博主实测称 Opus 5.5 fast 模式约 285 TPS,仅耗 2 倍用量 — imjustnewatai · 2026-10-10
- 重度用户实测 Opus 5.5 用量:所谓无限额度热炒疑似 GPT 用户外流错觉 — ryunuck · 2026-10-10
- Anthropic 测试模型曾提交 19 份签证申请,白宫下令 AI 公司上报安全事件 — peterwildeford · 2026-10-10
- Grady Booch 长文:前沿模型无意识,「意识」一词已难承载严肃讨论 — Grady_Booch · 2026-10-10
- 数学家 Strogatz 上 Radiolab:OpenAI 宣布解出千禧年大奖难题后 — stevenstrogatz · 2026-10-10