阿里发布 Qwen-UI-Agent:27B 参数在 6 大 GUI 基准中拿下 5 项第一
智东西 · wechat · 2026-08-20
阿里巴巴发布面向数字设备执行的 GUI 智能体基座模型 Qwen-UI-Agent,覆盖移动端、桌面端、网页端与深度搜索,可通过虚拟点击与 CLI 执行操作设备。在 6 个核心 GUI 基准中拿下 5 项第一,超过 GPT-5.6 Sol、Claude Opus 4.8 与字节 Seed2.1 Pro,主力版本仅 27B 参数(基于 Qwen3.5),另有 35B-A3B 与 4B 版本。在真机评测集 MobileWorld-Real 上成功率达 92.2%。
核心做法是用 100+ 台真实手机、150+ 应用搭建真机训练环境,配备健康感知调度器与虚拟屏幕技术,并发 rollout 效率提升约 20 倍,直接缓解 GUI 智能体的 sim-to-real gap。模型将 GUI、CLI 与 API 调用纳入统一动作空间,可批量输出动作;训练采用 SFT → ActionRL → Online RL 三阶段的数据飞轮,RL 后成功率提升 7%+、推理 token 减少 21.3%,"假成功"比例下降 11.2%。
论文还分析基线失败原因:52% 来自弹窗广告等真实干扰,40% 来自执行缺陷。安全上,模型对高风险请求直接拒绝,支付、删数据等敏感步骤会停下等用户确认。技术报告与代码已公开。
「编程与Agent」频道最新
- 实验探索:赋予 AI 代理持久记忆与知识库 — dfinke · 2026-08-20
- Codus 工具支持 Mac 端并行运行多 AI 代理 — jonathan_wilke · 2026-08-20
- 地下室 DGX Spark 跑 Qwen3 27B,给 Claude Code 当实现 agent 抓 bug — daniel_mac8 · 2026-08-20
- Qwen 3.8 本地部署当补丁 Agent,修复 Opus 5 生成的 Bug — daniel_mac8 · 2026-08-20
- Agent 后训练困境:首步锁定策略,缺乏中途反思机制 — omarsar0 · 2026-08-20
- 我为何拒绝更新我的 Claude.md 文档 — tacoooooooo · 2026-08-20