阿里手机规划基准:最强模型总分只有75.52%,记忆关卡更差

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi

cs.AI

2026-08-24

阿里 MAI 做了带活数据库的手机规划沙盒,1,705 题覆盖工具、委派、记忆和技能。Claude-Opus-5 加权总分 75.52%,记忆任务最好也只有 64.63%。

这篇在解决什么

手机上的 LLM 智能体要变成个人副驾驶,现有评测却分成两摊。GUI 基准(AndroidWorld、OSWorld)盯截图和点击,不测后台 API、权限和长程规划;静态 function-calling 基准(BFCL、DroidCall)只做离线 JSON 匹配,没有活的系统状态,也测不到运行时异常后怎么改计划。

真实任务更像「按用户常走的通勤习惯订机票和酒店」:要读本地记忆、调打包好的技能、扫二维码,API 不够用时还得把填表交给 GUI 子智能体。MobilePA-Bench 把这套规划循环做成可执行沙盒,把中心规划从像素点击里拆出来单独考。

方法

中心规划器只做决策。所有动作都是带 JSON schema 的函数:直接调 212 个手机工具、派发子智能体、搜用户记忆、加载技能。沙盒维护活的应用数据库,每次调用返回 Status、ErrorType 和 Payload,并改写后端状态。任务最多 15 步。

四条能力轴分开计分:

1,705 条任务按轴分配:基础工具 1,040、子智能体 89、记忆 376、技能 200,覆盖通讯、系统设置、出行等 13 个功能域。验收按证据分三桶:必须对上工具序列、只看数据库终态差、或看行为轨迹是否合理。记忆和技能另外加「必须命中标注 gold ID」的门。总分按 50/10/20/20 加权,缺预测一律算失败。候选工具召回固定为 Top-15。

结果

13 个前沿模型里,Claude-Opus-5 总分最高,也只有 75.52%。基础工具 83.85%(872/1,040),技能 78.00%,子智能体 62.92%,记忆 58.51%。记忆均值 50.98%,最好的 Qwen-3.8-Max 也只到 64.63%(243/376)。没有全能冠军:Gemini-3.1-Pro 子智能体 77.53%,记忆只有 48.67%。

Qwen3.6-27B 在相同设置下连跑三次,总分落在 57.22%–57.63%,标准差 0.22。基准抖动很小,模型本身不可靠。

模型总分基础工具记忆
Claude-Opus-575.5283.8558.51
Qwen-3.8-Max72.5177.8864.63
Gemini-3.1-Pro71.1880.5848.67
GPT-5.561.4468.9441.76

失败会跨轴叠加。一句「把通勤作息发给秘书」,同时要检索记忆、加载技能、改系统状态,还可能委派 GUI。单轴已经有可观错误率,端到端会更差。遇到能力边界或异常时,模型倾向直接胡编一次工具调用,而不是先问清或根据反馈改计划。

为什么重要

这是给「手机规划器」用的诊断板,不是又一张点屏幕排行榜。沙盒不渲染 GUI、可回放轨迹,论文明确把它当 agentic RL 的交互环境。做 on-device agent 的人应优先看记忆落地和委派质量,不要只刷工具选择准确率。

75.52% 意味着最强规划器仍有约四分之一任务失败,还谈不上可靠代操。各轴冠军还分散在不同模型上,目前没有能打包上线的统一规划器。

局限与存疑

GUI 被做成下游子智能体,中心规划器不看像素,真实端侧的感知和延迟瓶颈可能被低估。子智能体只有 89 题,三次重复里峰谷差 2.25 分,是四轴里最吵的一块。记忆和技能的 gold-ID 门比「做对任务」更严,跨论文不好直接比数字。评测用的是 2026 年一批商业模型名(Claude-Opus-5、GPT-5.6-Sol 等),可复现性取决于这些 API 是否还在。论文没有报告真实手机功耗和端侧延迟。

术语

原文与代码

相关论文

全部论文解读