字节新基准戳破GUI Agent神话:最强模型专业软件实操通过率仅30%

机器之心 · wechat · 2026-07-23

字节跳动 Seed 评测团队发布了 WorkflowGym 基准测试,将 GUI Agent 的考核从简单的日常办公软件转移到了 FreeCAD、Blender 等专业工业软件上,揭示了当前模型的真实能力边界。

评测设计与结果:

模型核心缺陷:

论文指出当前 Agent 框架存在四大死穴:长程一致性断裂(遗忘早期参数)、错误扩散且无法自我修复、目标漂移(漏掉最终验收点),以及对专业软件底层 UI 范式理解不足。这表明仅靠扩大参数规模无法解决这些架构级瓶颈,未来的人机协作才是最务实的产品形态。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →