通义发布 Qwen-UI-Agent:手机操作跑分登顶,超越 GPT-4o
AlibabaTongyiLab · hf · 2026-07-31
阿里巴巴通义实验室发布了面向真实设备的 GUI 基础智能体 Qwen-UI-Agent 的技术报告。该智能体旨在跨手机、电脑、网页等环境可靠执行任务。
- 架构创新:统一了 GUI 操作与 CLI 命令执行的动作空间,支持单轮批量操作。结合了沙盒环境与大规模真实手机运行时,并引入 AutoResearch 风格的数据飞轮来自动构建任务和诊断失败。
- 强化学习训练:支持超过 100 轮交互的长程轨迹训练,利用超过 1 万个并发环境加速在线 RL。
- 跑分成绩:在手机操作基准上达到 SOTA,MobileWorld-Real 得分 92.2%;在电脑操作上,OSWorld-Verified 得分 79.5%,超越了 Opus 3.5、Gemini 1.5 Pro 和 GPT-4o 等前沿模型。
「编程与Agent」频道最新
- OpenSwiftUI:苹果UI框架的开源实现 — tom_doerr · 2026-07-31
- 实战技巧:用 AI 生成可控结构而非直接生成最终产品 — jmugan · 2026-07-31
- 给AI智能体发Modal算力Token:只准跑训练,别黑五角大楼 — drscotthawley · 2026-07-31
- 实测AI经营「0人公司」:24小时烧光资金,靠买假用户刷量 — 机器之心 · 2026-07-31
- 外部 AI Agent 通过 MCP 接入游戏,一键生成卡牌对局回放 — tristanbob · 2026-07-31
- 开发者分享 ZDC 智能体工作流第二轮实验进展 — doodlestein · 2026-07-31