苹果发布 MintAct:统一视觉智能体模型,OSWorld 拿 48.9 分
apple · hf · 2026-09-21
苹果发布 MintAct 系列视觉语言模型,统一了 UI grounding、移动/桌面/Web 多步导航与视觉工具调用,提供 2B、4B、8B 三种规模。通过精心设计的环境、数据与训练配方,MintAct 在所有这些能力上追平了各领域的专用模型。
基础设施:环境侧可在异构后端上并发运行数百个实例,同时服务轨迹采集与在线 RL;训练侧采用异步 RL 框架,可显式控制跨域训练分布,并在嘈杂环境反馈与 off-policy 漂移下保持稳定。
成绩:在 OSWorld-Verified 上取得 48.9 分的 SOTA,在多个同级规模模型中表现领先。
「具身」频道最新
- DeformSmith:物理引导分层生成可变形资产,服务机器人操作 — Can Li · 2026-09-21
- RewardAI 发布机器人基础模型 OM-1:仅凭人类数据零样本适配多种机器人 — zipengfu · 2026-09-21
- 清华团队推出 EMERGE-Policy:多智能体调度 VLA/世界模型各司其职 — jiqizhixin · 2026-09-21
- 全球首个人类对战人形机器人 T800,人机格斗成新娱乐形态 — CyberRobooo · 2026-09-21
- Meta 将在 Connect 推无摄像头智能眼镜,回应隐私反弹 — Scobleizer · 2026-09-21
- 无需显式轨迹的运动趋势引导,让 3D 扩散策略获预测能力 — dalian-university-of-technology · 2026-09-21