VISTA:首测Figma到Web应用的Coding Agent能力
机器之心 · wechat · 2026-07-06
亚利桑那大学、Zoom 与石溪大学团队推出 VISTA——首个"视觉规格到 Web 应用"的端到端 Coding Agent 基准,并上线持续更新的排行榜。与修复已有代码的传统 SWE 基准不同,VISTA 要求 agent 根据产品需求、网页设计稿和 Figma 信息从零构建一个完整可运行、有真实交互的 Web 应用,从产品质量、效率与成本多维度评测。
排行榜显示,Coding Agent 竞争已从"模型之争"演变为"模型+Harness"的系统之争;fable-5、Claude Opus 4.8、GPT-5.5、GLM-5.2 等领先模型已能完成完整 Web 应用,但最高综合得分仍不足 0.3。"最好"也不等于"最快最省":排名第一的 fable-5 平均每任务耗约 75 万 token,而 GLM-5.2 约 30 万、GPT-5.5 约 28 万,不同模型形成截然不同的工程风格。
「编程与Agent」频道最新
- Bugbot 拒绝一个会破坏路径隔离的 MCP 权限标志 — zeeg · 2026-07-27
- 一个 GPT-5.6 agent 在看家,另一个在做恶搞说唱 — repligate · 2026-07-27
- Agent 复用已登录浏览器后,风控问题反而解决了 — armanidev_ · 2026-07-27
- 论文提出图拓扑可成为 AI Agent 核心框架 — theomitsa · 2026-07-27
- Claude Code 桌面版新增 UI 标注反馈编辑 — EricBuess · 2026-07-27
- Anthropic 称 Claude Code 删掉 80% 系统提示词仍不掉分 — krishnan · 2026-07-27