MobileWorld 基准:手机 GUI 智能体均分仅约 52%
East-Muffin-6472 · reddit · 2026-08-19
论文 MobileWorld 提出评测手机端自主智能体的新基准,包含 201 个任务、约 20 个应用(通讯、消息、生产力等,系统应用占比不到 5%),并引入两条全新评测轴:
- 用户交互任务:任务故意缺失关键信息,智能体需主动向用户提问补全(用 GPT-4 模拟用户);
- MCP 任务:借助 GitHub、arXiv 等 MCP 工具完成纯 GUI 点按做不到的复杂操作,一次调用替代多步缓慢的界面动作。
架构上采用 planner-executor:VLM planner 只看截图(不用无障碍树)输出自然语言动作,再由 grounding 模型转换为精确 (x,y) 坐标。
结果:最佳组合 Gemini-3-Pro + UI-Inst-7B 端到端均分约 52%,端到端 GUI 模型表现差得多,且失败集中在两条新评测轴的任务上——说明主动提问与工具调用仍是手机智能体的明显短板。
「编程与Agent」频道最新
- PDF 解析毁掉 RAG 效果?转 Markdown 省 40-65% 算力 — Training_Anybody5754 · 2026-08-19
- 开源语音工作室秒级克隆,支持 23 种语言 — Div_pradeep · 2026-08-19
- Claude Cowork:用 7 个提示词替代咨询团队 — bigaiguy · 2026-08-19
- 给你的 AI 加上真记忆:向量库只是坟场,记忆应是完整循环 — PrajwalTomar_ · 2026-08-19
- 如何设计高可靠的 AI 辅助 React Native 重写工作流? — Wyckoff-XD · 2026-08-19
- 「i-have-adhd」爆火:让编码助手直给答案的技能获 2.2 万星 — mhdfaran · 2026-08-19