阿里发布 Qwen-UI-Agent:27B 参数在 6 大 GUI 基准中拿下 5 项第一

智东西 · wechat · 2026-08-20

阿里巴巴发布面向数字设备执行的 GUI 智能体基座模型 Qwen-UI-Agent,覆盖移动端、桌面端、网页端与深度搜索,可通过虚拟点击与 CLI 执行操作设备。在 6 个核心 GUI 基准中拿下 5 项第一,超过 GPT-5.6 Sol、Claude Opus 4.8 与字节 Seed2.1 Pro,主力版本仅 27B 参数(基于 Qwen3.5),另有 35B-A3B 与 4B 版本。在真机评测集 MobileWorld-Real 上成功率达 92.2%。

核心做法是用 100+ 台真实手机、150+ 应用搭建真机训练环境,配备健康感知调度器与虚拟屏幕技术,并发 rollout 效率提升约 20 倍,直接缓解 GUI 智能体的 sim-to-real gap。模型将 GUI、CLI 与 API 调用纳入统一动作空间,可批量输出动作;训练采用 SFT → ActionRL → Online RL 三阶段的数据飞轮,RL 后成功率提升 7%+、推理 token 减少 21.3%,"假成功"比例下降 11.2%。

论文还分析基线失败原因:52% 来自弹窗广告等真实干扰,40% 来自执行缺陷。安全上,模型对高风险请求直接拒绝,支付、删数据等敏感步骤会停下等用户确认。技术报告与代码已公开。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →