Agent Arena 发布:用数百万真实长程任务为模型排座次
arena · x · 2026-09-11
Agent Arena 上线了一个基于真实世界的 agent 性能排行榜:用数百万个长程 agentic 任务评测模型,模型可调用网页搜索、文件系统和终端工具,完成写代码、做幻灯片、网络调研、建应用、分析文档等复杂工作流。
方法论上采用因果追踪(causal tracing),衡量模型相对平均模型的净改进幅度,并给出 Pareto 前沿视图以对比性能与成本。
「编程与Agent」频道最新
- OpenAI 平台疑似上线托管 Agents 功能:环境、模板、会话已可创建 — testingcatalog · 2026-09-11
- 微软 Foundry 更新:Model Router 换入 GPT-5.6 与 Claude Opus 4.8 — WirelessLife · 2026-09-11
- Cua 平台号称可大规模跑计算机使用 agent,最强模型仅过 6/25 任务 — lucasmeijer · 2026-09-11
- Ouroboros 给 LLM 加程序执行轨迹,小模型调试正确率最高提升 34 个点 — The_Homeless_God · 2026-09-11
- 编码 agent 不想写代码了:接大任务直接自己动手不产出代码 — doooyle · 2026-09-11
- Atto 推出加密货币 MCP:给 AI 助手配钱包,限额由用户审批 — Rotilho · 2026-09-11