AndroidLife 真机基准首跑:Qwen3.8-27B 控制 Android 手机成功率仅 56.7%
East-Muffin-6472 · reddit · 2026-09-18
新基准 AndroidLife 用真实手机(非模拟器)让 AI agent 执行日常任务,首跑结果是阿里巴巴的 Qwen3.8-27B 纯文本模式:60 个真实任务成功率 56.7%,已是当前榜单最好的文本模型成绩,但仍败了 43%。
关键数据:
- 每任务约 29.25 步、6 分钟,成本 $0.118
- 整机耗电 69%,芯片峰值温度 98.2°C,功放/表面 48.9°C,电池 37.9°C
- 难度分层:简单 80.8%、中等 52.9%、困难 23.5%;单应用尚可,三应用连续操作就在循环点按中耗尽步数上限
- 3 个自称完成的任务在真机上不成立(日历冲突判断错误、未打开地图看行程、擅自选名字)
planted 任务设计:11 个 ASK USER 任务(隐藏只有机主知道的事实),模型只在单问任务上主动提问,多问任务从不问;7 个幻觉对照任务中,4 个如实回答「数据不存在」,未捏造。
基准共 530 个公开任务、覆盖 28 天 31 个应用,按设备真实状态评分而非模型自述,后续还将跑 10 个模型。榜单与全部轨迹已公开。
「模型」频道最新
- 开发者称开源模型已达 SOTA,前沿双雄优势只剩 5GW 算力 — ccerrato147 · 2026-09-18
- Grok 语音转写 2.0 电话转写准确率达 92.9%,价格仅 $0.10/小时 — XFreeze · 2026-09-18
- Hugging Face 员工爆料:Meta 或即将在 HF 上发布 Muse Spark — eliebakouch · 2026-09-18
- 模型静默改版没处查:社区吐槽版本管理与模型卡披露缺失 — xeophon · 2026-09-18
- 疑似 Gemini 4 生成骑车孔雀 SVG,动画效果惊艳 — CodeByPoonam · 2026-09-18
- 疑似 Gemini 4 一句话 prompt 生成 Three.js 火箭场景 — CodeByPoonam · 2026-09-18