MobileWorld 基准:201 个任务测手机 GUI Agent,最好组合仅约 52%

East-Muffin-6472 · reddit · 2026-09-07

作者解读手机端自主 Agent 基准 MobileWorld,其新增两个评测维度:用户交互任务(信息缺失时 Agent 需主动追问,由 GPT-4 扮演用户)和 MCP 工具任务(通过 GitHub、arXiv 等 MCP 工具一步取数,绕过缓慢的 GUI 操作)。

该基准也是作者自制 benchmark 的基础。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →