Google Android Bench 2.0 发布:GPT 6 Astra 通过率 28% 居首
sandersted · x · 2026-09-23
Google 官方推出 Android Bench 2.0,新增长程任务(long-horizon)结果,用专门 agent 考察顶尖模型在真实 Android 应用开发上的能力,覆盖 30 个任务,报告通过率、完成率、平均耗时与成本:
- GPT 6 Astra + codex:通过率 28.0%,耗时 7.9 小时,成本 $375.7,居首
- Claude Fable 5.1 + claude-code:22.7%,22.2 小时,$492.6
- GPT 5.6 Sol + codex:19.3%,8.6 小时,$235.8
- Claude Opus 5:16.7%,27 小时,$861.4(最贵最慢)
- Qwen3.8 Max:14.0%,47.2 小时,$260.2
- Kimi K3:12.0%,66.2 小时
- Gemini 3.8 Flash:8.0%,但只要 12.1 小时
该基准聚焦 Android 开发特有的挑战,现有通用基准未覆盖,旨在衡量高质量 Android 开发这一「北极星」。
「编程与Agent」频道最新
- 大字典典断言毁测试可读性,Syrupy 快照让 pytest 保持整洁 — KhuyenTran16 · 2026-09-23
- pytest 断言越写越长?用 Syrupy 快照文件让大输出测试恢复可读 — KhuyenTran16 · 2026-09-23
- Netlify AI Gateway 上线 Claude Opus 5.5,零配置即可在 Functions 中调用 — thisiskp_ · 2026-09-23
- LLM 评测分数抖动别瞎追:用 20 行 Python 自举置信区间 — bgoncalves · 2026-09-23
- Jev API 实验清单热传:桌面自动化、玩马里奥、控无人机五个上手项目 — blaizedsouza · 2026-09-23
- 把 agent 接到外部服务前,先用这个 prompt 核对账号与环境 — gethackteam · 2026-09-23