Agent Arena 发布:数百万真实长程任务评测模型智能体能力

Agent Arena 上线了一个基于真实世界的模型智能体能力评测榜,采用数百万个长程 agentic 任务,模型需调用网页搜索、文件系统和终端等工具,完成写代码、做幻灯片等复杂工作流。评测采用因果追踪方法对模型能力进行归因与排名,为衡量各模型的智能体表现提供了新基准。

2026-09-11 ~ 2026-09-11 · 2 条相关