AndroidWorld 揭秘:为何手机 Agent 基准测不准?
East-Muffin-6472 · reddit · 2026-09-02
AndroidWorld 是一个新的手机 Agent 基准测试论文,揭示了以往 Android Agent 基准测试存在的根本缺陷:静态测试集导致模型实际上是在“背答案”而非展示能力。
核心创新:
- 参数化任务模板:使用包含变量的模板(如“在 {星期} {时间} 创建标题为 '{标题}' 的日历事件”),每次运行时采样生成数百万种唯一任务组合,彻底杜绝了死记硬背。
- 自动化验证:基于真实 Android 模拟器,每个任务内置 initialize()、issuccessful() 和 teardown() 函数,通过 ADB 检查 OS 状态来判定成功与否,无需人工评判,完全可复现。
测试结果 (M3A Agent + GPT-4 Turbo):
- AndroidWorld (116 任务/20 真实应用):成功率 30.6% (人类 80%)。
- MobileMiniWoB++ (Web 任务):成功率 68% (人类 100%)。
- 延迟问题:Agent 平均每任务耗时 3.9 分钟,比人类慢 3 倍。
关键发现:固定随机种子下 Agent 看起来完全无能,但变动种子后却能解决相同任务。这证明了静态基准测试往往只是在测试不幸的参数组合,而非 Agent 真实能力。
「具身」频道最新
- 印度女性机器人创始人社群活动预告 — alysha_lobo · 2026-09-02
- GoatRemote 更新:用 Siri 遥控 Mac 的 AI 语音指令 — mayfer · 2026-09-02
- 年产千万台机器人需数亿电机,供应链恐成最大瓶颈 — Scobleizer · 2026-09-02
- 入手 6279 美元 RTX 5090 整机,是否踩雷? — Sexyvette07 · 2026-09-02
- 硬核调试:修改寄存器让 Feetech 舵机更丝滑 — kamathsblog · 2026-09-02
- GoPro 寻求出售,败给中国深圳硬件产业链 — alexmacgregor__ · 2026-09-02