苹果发布 MintAct:统一视觉智能体模型,OSWorld 拿 48.9 分

apple · hf · 2026-09-21

苹果发布 MintAct 系列视觉语言模型,统一了 UI grounding、移动/桌面/Web 多步导航与视觉工具调用,提供 2B、4B、8B 三种规模。通过精心设计的环境、数据与训练配方,MintAct 在所有这些能力上追平了各领域的专用模型。

基础设施:环境侧可在异构后端上并发运行数百个实例,同时服务轨迹采集与在线 RL;训练侧采用异步 RL 框架,可显式控制跨域训练分布,并在嘈杂环境反馈与 off-policy 漂移下保持稳定。

成绩:在 OSWorld-Verified 上取得 48.9 分的 SOTA,在多个同级规模模型中表现领先。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →