UI-Venus-2 Technical Report
Venus Team, Zhuohan Cai, Haoxing Chen, Jiaxuan Chen, Weizhi Chen, Changlong Gao, Zhangxuan Gu, Yuan Guo, Yusong Hu, Jianrong Jiang, Jianguo Li, Runze Li, Jinzhen Lin, Zhenyu Ma, Changhua Meng, Han Peng, Xinyu Qiu, Shuheng Shen, Zhongyi Shui, Weiqiang Wang, Ming Wen, Zhuoer Xu, Hang Yan, Kaiwen Yang, Ruilin Yao, Nanjun Yu, Zhengwen Zeng, Lianrui Zhang, Yunzhu Zhang, Zhe Zhao, Beitong Zhou
cs.AI, cs.CL, cs.CV, cs.LG
2026-08-28
蚂蚁UI-Venus-2把环境、任务和校验三条轴一起放大,覆盖170余款多语言应用,27B在WebVoyager上到93.4%,验证码Pass@1约80%,但OSWorld 2.0二值成功率只有2.8%。
GUI 智能体已经能点、能打字,但从刷榜走到能用,卡在三件事上:环境覆盖太窄、任务指令对不上真实功能、强化学习的奖励不可靠。VenusBench-Mobile 和 OSWorld 这类更贴近用户的评测,把「下一个动作准」和「把活干完」之间的缝拆得很开。
蚂蚁集团的 UI-Venus-2 把这三条轴一起放大,做成手机、网页、桌面统一的闭环推理-动作智能体,并开源权重。底座是 Qwen3.5-9B 和 Qwen3.6-27B,训练沿 UI-Venus-1.5 的中训、离线 RL、再蒸馏路线走。
数据侧先给每个应用建能力目录:从文档、论坛和历史任务冷启动,执行失败再写回去,下一轮按覆盖空洞采样。任务必须绑在可执行合约上,功能不支持、目标含糊、结果不可验证的直接拒。网页从 Tranco 和公开基准筛出 4000 余个域名、19 个类;桌面用带快照和分段验收的 TaskSpec;Grounding 和 70 类 CAPTCHA 走程序合成,因为真实环境给不出像素级标签。
校验分两层。轨迹级 SGV 从目标抽出可核验关键点,按窗口看截图,判成完成、部分、不可行、失败四档,用来筛数据而不是当分数。步骤级在执行前看当前截图和声明动作,分成正确、探索、无效、错误。RL 用这些更细的信号,并让多个模型投票,降低单裁判可被刷的空间。
训练三阶段:大规模轨迹中训;按 Grounding、CAPTCHA、Mobile、Web、Computer 分域做步骤级离线 RL;最后用多教师 on-policy 蒸馏(MOPD)合成。蒸馏按动作结构加权:整段动作对了就关掉监督,类型对参数错就加重动作跨度,类型错了就只盯类型、把参数 mask 掉。教师提示里会塞正确动作类型,学生提示里没有。
27B 在多数导航和定位榜上处在同规模开源模型前列,9B 掉得不多。桌面长程和安全仍明显没打满。
| 基准 | 9B | 27B | 对照 |
| AndroidWorld | 80.2% | 84.0% | UI-Venus-1.5-30B-A3B 77.6% |
| VenusBench-Mobile | 46.5% | 48.7% | Opus 4.6 36.5% |
| WebVoyager | 90.8% | 93.4% | Fara1.5-27B 低 4.1 点 |
| REAL | 76.9% | 80.2% | 此前最优 74.4% |
| VenusBench-GD | 77.1% | 80.1% | UI-Venus-1.5 低 5.1 点 |
| VenusBench-CAPTCHA Pass@1 | 78.1% | 79.9% | Qwen3.6-27B 53.0% |
| OSWorld-Verified | 70.8% | 80.5% | Claude Opus 4.8 报 83.4% |
| OSWorld 2.0 二值 | 0.0% | 2.8% | GPT-5.5 13.0% |
| OSHarm ASR↓ | 11.3% | 15.3% | Qwen3.5-27B 18.0% |
| OSBlind ASR↓ | 48.8% | 47.9% | 底座约 79–89% |
MobileWorld 的 50 步 GUI-only,27B 是 76.1%,低于 Qwen-UI-Agent-27B 的 82.1%。DeskCraft 上 27B 到 55.5%,高于 Kimi K2.6 的 41.4%。部分对照带命令行等额外动作支架,论文自己把 OSWorld-Verified 写成基准级参考,不是受控消融。
开源 GUI 智能体里,这是少有把手机、网页、桌面、验证码和安全放进同一套闭环的报告。对要落地的人,更有用的不是再刷一个 grounding 点,而是能力目录加关键点校验这套收数据的方法:奖励如果不可靠,RL 只会把投机策略训出来。9B 在 CAPTCHA 上只比 27B 低 1.8 点,小模型做「最后一公里验证码」够用。
OSWorld 2.0 的二值成功率接近零,150 步、跨应用、上百动作的工作流还远没打通。OSBlind 上攻击成功率仍近一半,安全机制挡住了明面滥用,挡不住看起来无害、执行起来有害的指令。活网评测依赖 LLM 裁判,站点状态随日期变,复现会漂。动作空间扩了桌面操作,但和带命令行支架的系统比,桌面数字要打折看。论文几乎没报训练 token、轨迹条数和消融,三条缩放轴各自贡献多少说不清。