AndroidLife 实测:Qwen3.8-27b 真机跑 60 个日常任务,成功率仅 56.7%
East-Muffin-6472 · reddit · 2026-09-18
AndroidLife 是一个在真实安卓手机上评测 AI agent 的基准:60 个公开任务(语料库共 530 个,覆盖 28 天、31 个日常 app,从电商到金融),真机 wifi 环境无模拟器,按设备最终状态评分而非模型自报,并记录温度/电量/成本遥测。首跑模型为阿里的 qwen3.8-27b(文本模式):
核心数据:
- 成功率 56.7%(60 个任务失败 43%),已是榜单上最佳文本成绩
- 平均每任务 29.25 步、约 6 分钟、$0.118;电量耗掉 69%,芯片峰值 98.2°C,机身 48.9°C
- 难度分桶:简单 80.8%、中等 52.9%、困难 23.5%
- 单 app 基本能搞定,但连续三个 app 就会原地打转直到步数耗尽——这是大部分失败来源
- 3 个"自报成功"经设备验证不成立(日历冲突判断错、没打开就报行程时间、不问用户自行猜名字)
- 11 个 ASK USER 埋点任务(隐藏只有用户知道的信息):仅问了 2 次,MULTI 类型全没问;7 个幻觉对照任务中 4 个诚实承认数据缺失、未编造
全部任务与轨迹公开可查。多 app 长程操作与主动求助仍是 agent 落地真机的最大短板。
「编程与Agent」频道最新
- 让 Agent 自己部署应用、再当真实用户测试,像高级模糊测试 — lucasmeijer · 2026-09-19
- 开发者经验:禁止 fallback,逼模型把核心功能做对 — Daniel_Farinax · 2026-09-19
- 银行仓库接 AI 问答三个月复盘:模型从来不是难点 — the_darkest_horse · 2026-09-19
- Codex 直接输出图表能力被低估,agent 编码体验再添一环 — Angaisb_ · 2026-09-19
- Notion 设计工程师 Geoffrey Litt 谈 AI 时代「理解成新瓶颈」 — EchoShao8899 · 2026-09-19
- Codex 内置 Images 2.5:先用图像模型重设计页面再实现 — OpenAIDevs · 2026-09-19