Android Bench更新模型榜
Ars Technica AI · rss · 2026-07-09
Google 更新了用于评估 Android 应用开发能力的 Android Bench,并加入了多款新模型与新的评价维度。
这次更新不仅补充了 成本 和 效率 指标,还纳入了开权重模型,方便开发者更全面地比较不同 LLM 在 Android 开发任务上的表现。Google 也邀请开发者自行跑测试并反馈,以影响基准后续演进。
新增的模型包括:Claude Fable 5、Claude Sonnet 5、Claude Opus 4.8、GLM 5.2、Kimi K2.7 Code、MiniMax M3、Qwen 3.7 Plus、Qwen 3.7 Max。文章的结论是:Gemini 在这个榜单上仍然落后于部分竞争模型。
「模型」频道最新
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11