MobileWorld 基准:201 个任务测手机 GUI Agent,最好组合仅约 52%
East-Muffin-6472 · reddit · 2026-09-07
作者解读手机端自主 Agent 基准 MobileWorld,其新增两个评测维度:用户交互任务(信息缺失时 Agent 需主动追问,由 GPT-4 扮演用户)和 MCP 工具任务(通过 GitHub、arXiv 等 MCP 工具一步取数,绕过缓慢的 GUI 操作)。
- 共 201 个任务、约 20 个应用,覆盖通讯、消息、生产力等日常场景,系统应用占比不到 5%(多为开源替代品,是短板)
- 架构:planner-executor,planner 为 VLM,仅输入截图、输出自然语言动作,再由 grounding 模型转成精确坐标
- 最好成绩约 52%(Gemini-3-Pro + UI-Inst-7B),纯端到端 GUI 模型明显更差
- 两个新维度的任务是模型主要失分点
该基准也是作者自制 benchmark 的基础。
「编程与Agent」频道最新
- 创业者自述:用 agentic 软件工厂撑起大半个生意 — hugobowne · 2026-09-07
- 从代码小船到 Blender 精细船模:Astra 迭代 3D 资产全过程 — Dimillian · 2026-09-07
- 零代码网友用 ChatGPT+Claude+Gemini CLI 搭出本地隐私 AI 助手 — Particular-Shape1972 · 2026-09-07
- Anthropic 推出免费 4 小时 AI 工程课程,聚焦 Claude 编程实战 — Aiden_Tech_Ai · 2026-09-07
- Conductor 被推荐为可搭配 Claude、Codex、GLM、Kimi 的编码工具 — ayushtweetshere · 2026-09-07
- 结构上杜绝编造引用:开源文献综述流水线放出完整演示视频 — Waste_Public_2985 · 2026-09-07