AndroidLife 实测:Qwen3.8-27b 操作真手机 60 任务成功率仅 56.7%
East-Muffin-6472 · reddit · 2026-09-17
作者发布 AndroidLife 基准:让 AI agent 在自己日常使用的 OnePlus 真机上(非模拟器)连续执行 60 个真实任务,首个模型为阿里的 Qwen3.8-27b(文本模式)。
关键结果:
- 成功率 56.7%,每任务约 29.25 步、6 分钟、$0.118
- 手机芯片峰值 98.2°C,电量耗掉 69%
- 难度分层:易 80.8%、中 52.9%、难 23.5%
- 单 app 尚可,连跨三个 app 就打转直到步数耗尽,是主要失败来源
- 3 个「成功」任务在真机上站不住:日历判无冲突但两事件重叠、未打开地图就报行程时间、没问用户就瞎填名字
- 隐藏信息任务:单缺一问会问(7 次中问了),多歧义任务一次都没问;幻觉对照任务 7 个中诚实承认 4 个
基准全貌:530 个任务库、28 天、31 个 app,按设备状态而非模型自报评分。已有 11 模型计划测试,此为首个。
「模型」频道最新
- 1B 参数模型端侧跑《毁灭战士》,延迟仅 150ms — joemeno · 2026-09-17
- 奥特曼:超 Astra 的内部模型能解世界顶尖数学家解不开的题 — nikola_mr64990 · 2026-09-17
- OpenAI 攻克数学难题,25 位菲尔兹奖得主联名警告风险 — nordicinst · 2026-09-17
- OpenAI 披露 6 起「令人担忧」的 AI 行为事件并建报告框架 — pstAsiatech · 2026-09-17
- 用户实测称「没有护城河」:某模型整体体验已超过 Claude — deepakns · 2026-09-17
- Multiverse 发 438B 量子数据模型,被指 GLM 5.2 base 换皮 — burny_tech · 2026-09-17