COLM 现场:手机 agent 基准 iOSWorld 等 200 长程网页任务基准将亮相
kohjingyu · x · 2026-10-05
Google 研究员 Koh Jingyu 整理了自己在 COLM 会议的三场展示:
- iOSWorld(10/8 海报 #81):在真实 iOS 环境中评测手机 agent 的 benchmark。
- Odysseys(10/8-9 海报 #46):200 条源自真实浏览会话的长程网页任务,在真实互联网上评测。
- Multi-Agent Computer Use(MACU)(10/9 workshop):由一个 manager 模型把计算机使用任务拆解为并行子任务的多 agent 框架,可同时提升成功率与速度。
他表示当前最关注的方向是复杂任务 CUA(含科学应用)、支持多 agent 协作的新模型架构。
「编程与Agent」频道最新
- Supabase Select 发布:schema 入代码、本地免 Docker、agent 可管生产 — dshukertjr · 2026-10-06
- 开发者实测:Claude Opus 像毛躁初级,Codex 更像沉稳资深 — ssh4net · 2026-10-06
- 推算 DeepSeek 一个月跑 13 亿个沙箱:峰值 17 万并发,约 3-5 分钟一个 — teortaxesTex · 2026-10-06
- Burkov:别担心 AI 代码没人能维护,反正不再需要人来懂 — burkov · 2026-10-06
- 「一次 Claude Code 会话替代不了整个软件」:泼冷水式观点引发讨论 — seatedro · 2026-10-06
- 「Eval 就是产品规格书」:AI 产品团队最常犯的评测定位错误 — realmadhuguru · 2026-10-06