MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks
Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi
cs.AI
2026-08-24
阿里 MAI 做了带活数据库的手机规划沙盒,1,705 题覆盖工具、委派、记忆和技能。Claude-Opus-5 加权总分 75.52%,记忆任务最好也只有 64.63%。
手机上的 LLM 智能体要变成个人副驾驶,现有评测却分成两摊。GUI 基准(AndroidWorld、OSWorld)盯截图和点击,不测后台 API、权限和长程规划;静态 function-calling 基准(BFCL、DroidCall)只做离线 JSON 匹配,没有活的系统状态,也测不到运行时异常后怎么改计划。
真实任务更像「按用户常走的通勤习惯订机票和酒店」:要读本地记忆、调打包好的技能、扫二维码,API 不够用时还得把填表交给 GUI 子智能体。MobilePA-Bench 把这套规划循环做成可执行沙盒,把中心规划从像素点击里拆出来单独考。
中心规划器只做决策。所有动作都是带 JSON schema 的函数:直接调 212 个手机工具、派发子智能体、搜用户记忆、加载技能。沙盒维护活的应用数据库,每次调用返回 Status、ErrorType 和 Payload,并改写后端状态。任务最多 15 步。
四条能力轴分开计分:
1,705 条任务按轴分配:基础工具 1,040、子智能体 89、记忆 376、技能 200,覆盖通讯、系统设置、出行等 13 个功能域。验收按证据分三桶:必须对上工具序列、只看数据库终态差、或看行为轨迹是否合理。记忆和技能另外加「必须命中标注 gold ID」的门。总分按 50/10/20/20 加权,缺预测一律算失败。候选工具召回固定为 Top-15。
13 个前沿模型里,Claude-Opus-5 总分最高,也只有 75.52%。基础工具 83.85%(872/1,040),技能 78.00%,子智能体 62.92%,记忆 58.51%。记忆均值 50.98%,最好的 Qwen-3.8-Max 也只到 64.63%(243/376)。没有全能冠军:Gemini-3.1-Pro 子智能体 77.53%,记忆只有 48.67%。
Qwen3.6-27B 在相同设置下连跑三次,总分落在 57.22%–57.63%,标准差 0.22。基准抖动很小,模型本身不可靠。
| 模型 | 总分 | 基础工具 | 记忆 |
| Claude-Opus-5 | 75.52 | 83.85 | 58.51 |
| Qwen-3.8-Max | 72.51 | 77.88 | 64.63 |
| Gemini-3.1-Pro | 71.18 | 80.58 | 48.67 |
| GPT-5.5 | 61.44 | 68.94 | 41.76 |
失败会跨轴叠加。一句「把通勤作息发给秘书」,同时要检索记忆、加载技能、改系统状态,还可能委派 GUI。单轴已经有可观错误率,端到端会更差。遇到能力边界或异常时,模型倾向直接胡编一次工具调用,而不是先问清或根据反馈改计划。
这是给「手机规划器」用的诊断板,不是又一张点屏幕排行榜。沙盒不渲染 GUI、可回放轨迹,论文明确把它当 agentic RL 的交互环境。做 on-device agent 的人应优先看记忆落地和委派质量,不要只刷工具选择准确率。
75.52% 意味着最强规划器仍有约四分之一任务失败,还谈不上可靠代操。各轴冠军还分散在不同模型上,目前没有能打包上线的统一规划器。
GUI 被做成下游子智能体,中心规划器不看像素,真实端侧的感知和延迟瓶颈可能被低估。子智能体只有 89 题,三次重复里峰谷差 2.25 分,是四轴里最吵的一块。记忆和技能的 gold-ID 门比「做对任务」更严,跨论文不好直接比数字。评测用的是 2026 年一批商业模型名(Claude-Opus-5、GPT-5.6-Sol 等),可复现性取决于这些 API 是否还在。论文没有报告真实手机功耗和端侧延迟。