字节新基准戳破GUI Agent神话:最强模型专业软件实操通过率仅30%
机器之心 · wechat · 2026-07-23
字节跳动 Seed 评测团队发布了 WorkflowGym 基准测试,将 GUI Agent 的考核从简单的日常办公软件转移到了 FreeCAD、Blender 等专业工业软件上,揭示了当前模型的真实能力边界。
评测设计与结果:
- 测试覆盖 56 款专业软件和 338 个真实长链条工作流,平均操作步数超 100 步。
- 在严苛的专业任务中,表现最好的 Gemini 3.1 Pro 和 Kimi K2.6 单次通过率仅为 30% 出头,在 60 步以上的 Hard 题型中,轻量级模型几乎全军覆没。
模型核心缺陷:
论文指出当前 Agent 框架存在四大死穴:长程一致性断裂(遗忘早期参数)、错误扩散且无法自我修复、目标漂移(漏掉最终验收点),以及对专业软件底层 UI 范式理解不足。这表明仅靠扩大参数规模无法解决这些架构级瓶颈,未来的人机协作才是最务实的产品形态。
「模型」频道最新
- 曝 Meta Muse Agent 内置邀请码逻辑,或携额外免费额度上线 — testingcatalog · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11