MintAct: A Unified Visual Agent for Digital Environments
Mingfei Gao, Rui Tian, Haiming Gang, Bohan Zhai, Le Zhang, Yuanzheng Gong, Di Feng, Ege Özsoy, Kaixin Ma, Vishwesh Kirthivasan, Oğuzhan Fatih Kar, Roman Bachmann, Anders Boesen Lindbo Larsen, Afshin Dehghan
cs.CV
2026-09-19
2B到8B的统一视觉agent覆盖grounding、手机桌面网页导航和视觉工具调用。MintAct-8B把OSWorld-Verified从33.9做到48.9,AndroidWorld从47.6做到67.0,同尺寸专科大多被对齐。
像素级数字助手要同时做三件事:把指令点到屏幕坐标、在手机/桌面/网页上多步导航、看见图再去调外部工具。现有工作把这几块拆成专科模型,各自的观察、动作、数据和可执行环境都不一样,硬拼动作空间或混数据会互相拖后腿。小参数还要上端侧,养一排专科模型不划算。
难处不在「再训一个 VLM」。GUI 环境慢、不稳、轨迹又长又多模态;异步 RL 若放任采样,哪个域滚得快,训练分布就歪向哪里。统一是数据、环境和训练协议问题。
Apple 的 MintAct 是 2B/4B/8B 一组,初始化来自 Qwen3-VL-Instruct。观察统一成原始截图,坐标归一到 999×999,不用 DOM 或无障碍树。动作集不合并,靠域专用系统提示把模型拐进对应 token。训练分布在监督和 RL 阶段都按域显式配平。
配方分四段。高分辨率单步 SFT 先打 grounding 和单步导航;低分辨率多步 SFT 用各域轨迹学长程,四域各 25%,轨迹最多 30 步(工具域 100 步)。然后在每个域上单独做 RL 专科,再把专科轨迹经 VLM 裁判筛成功样本,蒸馏回一个权重,这一步叫 RFT。最后只在手机和桌面环境上做联合异步 RL。
环境侧,桌面基于 OSWorld,训练时可并发 200 多个实例;手机基于 AndroidWorld,100 多个;网页用 Weblica 的缓存回放和合成站,躲开线上反爬;工具域用 MM-ToolSandBox,500 多个原生工具走动态检索,避免把整张工具表塞进提示。异步框架把 rollout 和训练解开,用有界队列和周期性同步压 staleness,环境故障轨迹从损失里掩掉,并对 serving 引擎和 trainer 的数值差做截断重要性加权。
8B 相对 Qwen3-VL-8B:AndroidWorld 47.6→67.0,OSWorld-Verified 33.9→48.9,Weblica 55.5→74.7,MM-ToolSandBox 3.1→24.5。同尺寸公开模型里,MintAct-8B 在 OSWorld-Verified(48.9,EvoCUA-8B 为 46.1)、Weblica(74.7,WEBLICA-8B 为 70.6)、UI-Vision(56.6)和 OSWorld-G(64.5)上最高。AndroidWorld 的 67.0 仍低于 MAI-UI-8B 的 70.7,统一没有在每个格子都拿到第一。
| 模型 | OSWorld-Verified | AndroidWorld | Weblica | MM-ToolSandBox |
| Qwen3-VL-8B | 33.9 | 47.6 | 55.5 | 3.1 |
| MintAct-8B | 48.9 | 67.0 | 74.7 | 24.5 |
| 对照专科 | EvoCUA 46.1 | MAI-UI 70.7 | WEBLICA 70.6 | — |
消融很清楚。只做高分辨率 grounding,OSWorld-Verified 掉到 9.4;只做多步 SFT,UI-Vision 从 59.3 掉回 25.0。两段拼起来才能两边都留住。RFT 之后联合 RL 把 OSWorld-Verified 从 43.1 再推到 48.9,网页也跟着涨(Weblica 72.8→74.7),AndroidWorld 略降 1.1 分。纯合成环境 RL、完全不碰真机模拟器,也能把 AndroidWorld 做到 60.3、OSWorld-Verified 做到 38.6;有真环境时,真环境联合 RL 更强。
一份 8B 权重在 grounding、三端导航和视觉工具调用上能跟上同尺寸专科,端侧想塞一个助手时,不必为每个域各服一个模型。工程上更可抄的是那套异构环境异步 RL:显式管配比,而不是让最快的环境主导梯度。合成环境在缺真数据时有迁移,有真环境以后它就让位,这个次序对后来者省预算有用。
联合 RL 仍只覆盖手机和桌面,网页和工具域的终局分数很大程度吃的是 SFT/RFT 和迁移,不是四域一起在线优化。
论文自己写了几条。联合 RL 没有扩到网页和工具域,资源扛不住同时挂住全部异构后端。训练把每张截图追加进上下文,长程任务显存会爆。视觉工具调用目前仍像另一项能力,模型和导航之间还没有「该点就点、该调 API 就调」的统一策略。动态工具注册会改系统提示前缀,前缀缓存变差。评测步数上限导航 30、工具 100,更长任务怎么掉点没有报。AndroidWorld 上仍落后 MAI-UI-8B,统一的代价在移动端没有完全消失。