腾讯混元 AutoGUIWorld:用图像生成器当 GUI 世界模型,不跑软件合成 7.9 万条轨迹
Tencent-Hunyuan · hf · 2026-10-02
腾讯混元团队推出 AutoGUIWorld,用图像生成器的视觉先验加规划器的任务知识,无需部署真实软件环境即可合成 GUI agent 交互轨迹。
- 从操作系统上下文、外观与界面状态的结构化规格采样初始 GUI 场景,并据此生成任务;
- 规划器指定原子动作及预期视觉后果,图像生成器逐步编辑当前截图产出后续观测;
- 经动作接地与转移级质量过滤,产出覆盖 Ubuntu、Windows、macOS、Chrome 的 79,266 条带空间标注的步级训练样本。
用这些轨迹微调 Qwen3.5-35B-A3B 后,OSWorld 平均任务分从 33.0% 提到 40.8%,ScienceBoard 成功率从 14.0% 提到 32.2%,证明合成轨迹能提升真实桌面与科研任务的 GUI agent 表现。
「编程与Agent」频道最新
- AgentWorld 研究:多智能体协作任务成功率仅 12% — omarsar0 · 2026-10-02
- 开发者用 GPT 复刻 DOOM 类游戏,血腥度还原原版并即将开源 — DeryaTR_ · 2026-10-02
- 把 AI Agent 接进 homelab:让智能体真实操作自己的服务器 — Academic_Wolverine · 2026-10-02
- 用流程挖掘 agent 审计企业工作流:文档写 7 步,实际 20 步 — vasuman · 2026-10-02
- Geoffrey Huntley 反驳「两周后大家都得回去读代码」 — kieranklaassen · 2026-10-02
- Claude Skills 入门:从 PDF 填表看提示词与 Skill 的真正区别 — lxfater · 2026-10-02