字节新基准戳破GUI Agent神话:最强模型专业软件实操通过率仅30%
机器之心 · wechat · 2026-07-23
字节跳动 Seed 评测团队发布了 WorkflowGym 基准测试,将 GUI Agent 的考核从简单的日常办公软件转移到了 FreeCAD、Blender 等专业工业软件上,揭示了当前模型的真实能力边界。
评测设计与结果:
- 测试覆盖 56 款专业软件和 338 个真实长链条工作流,平均操作步数超 100 步。
- 在严苛的专业任务中,表现最好的 Gemini 3.1 Pro 和 Kimi K2.6 单次通过率仅为 30% 出头,在 60 步以上的 Hard 题型中,轻量级模型几乎全军覆没。
模型核心缺陷:
论文指出当前 Agent 框架存在四大死穴:长程一致性断裂(遗忘早期参数)、错误扩散且无法自我修复、目标漂移(漏掉最终验收点),以及对专业软件底层 UI 范式理解不足。这表明仅靠扩大参数规模无法解决这些架构级瓶颈,未来的人机协作才是最务实的产品形态。
「模型」频道最新
- Open-weight 中文大模型不等于真正开源 — tamla_htoo · 2026-07-23
- 中国开源模型短期反而在加固 NVIDIA 的推理护城河 — zephyr_z9 · 2026-07-23
- Kimi 生成奢华腕表渲染图,连机芯细节都很完整 — cedric_chee · 2026-07-23
- Qwen3.8-Max 在 3D Web 前端上被评更强于 Kimi K3 — cedric_chee · 2026-07-23
- 有人判断 Opus-5 可能在成本性能上压过 Fable — adonis_singh · 2026-07-23
- Claude Opus 4.8 似乎能不搜网页就认出 `@flowersslop` — JasonBotterill · 2026-07-23