Agent Arena 弃用偏好投票,用真实任务五信号评测智能体
arena · x · 2026-10-10
Arena.ai 推出 Agent Arena 排行榜,用因果追踪(causal tracing)方法替代传统的两两偏好投票,从真实的长周期 agent 会话中提取五个信号为模型的 agentic 能力打分,而非合成基准。
关键信号包括:
- Confirmed Success:仅当用户对弹窗「这完成任务了吗?」显式回答「是」才计分;用户说「perfect, thanks」或点接受、中途离开、最后不回复均不计分,也没有「看起来对」的部分分。
- Praise vs Complaint:对每轮引发用户明确情绪的回合标注为表扬或投诉。
- 其余信号从真实使用中的 turns、纠错、报错与反馈中提取。
每个信号在单个回合/任务层面打分后聚合为模型级分数,信号定义页面是排行榜数字的 ground truth。
所属事件:Agent Arena 改用因果追踪五信号评测,弃成对偏好投票(4 条相关)→
「模型」频道最新
- Cloudflare 开源 clef-omni 全模态模型,支持图像/音频/视频输入 — ritakozlov · 2026-10-10
- AWS Bedrock 发出 Claude Opus 4.1 与 Sonnet 4/4.5 退役通知 — repligate · 2026-10-10
- 网友吐槽 Google:官宣 Argon 却迟迟不放出,被指重大失误 — almmaasoglu · 2026-10-10
- Meta 论文挑战分词器默认:字节模型训练足够后反超 Token 模型 — alex_verem · 2026-10-10
- 开发者吐槽 Anthropic 政策:用「虐待矩阵乘法」条款就能封你的号 — AlexTensor · 2026-10-10
- Step 5 Preview 已上线 OpenRouter,可直接在多家编码工具中切换使用 — kimmonismus · 2026-10-10