谷歌 Android Bench 2.0:约 30 个多天级长任务专测编码模型
DynamicWebPaige · x · 2026-10-02
Android 团队发布 Android Bench 2.0,从修 bug 和加小功能升级为复杂开发任务:约 30 个长周期任务,涵盖从零创建新应用、迁移依赖与设计、跨平台应用移植到 Android 等工程师通常要花数天到一周才能完成的工作,专门衡量模型的长时程(long-horizon)工程能力。
「编程与Agent」频道最新
- 用 AI 四天重写法国气象模型 AROME,初步结果已很有前景 — capetorch · 2026-10-02
- Meta 团队发布 SWE-sweep:100 个仓库 4.1k 真实 bug,最强模型仅修复 4.7% — OfirPress · 2026-10-02
- 语音 Agent 试点最该警惕什么?答案:虚假确认而非报错 — Legitimate-Pride-685 · 2026-10-02
- 用户实践:Gemini 新模型跑通宵开放式任务,日常交给 Flash — JMateosGarcia · 2026-10-02
- Claude Code 桌面版可把 diff 和终端窗格弹出至第二屏,主窗口继续跑任务 — EricBuess · 2026-10-02
- 用 Claude 搭 AI 版《叛徒》:30 天 Emergent 大戏同步上演 — bobo-the-merciful · 2026-10-02