Qwen 发布 RecreationBench:250 任务实测 AI 重建真实应用
burny_tech · x · 2026-09-21
Qwen 在 Hugging Face 上发布了 RecreationBench,一个包含 250 个任务的基准,横跨 Ubuntu、macOS、Windows、Android 和 Web 五个平台,专门测试混合式 computer-use 智能体从零重建真实应用的能力。
与常见截图点击类 computer-use 评测不同,该基准考察的是 agent 对真实应用的完整理解与复现能力,为评估端到端软件构建型 agent 提供了新的标尺。
「编程与Agent」频道最新
- 被 Agent 要 API 密钥,敷衍一句它真自己搞定了 — shakoistsLog · 2026-09-21
- Pretty Mermaid 开源:让 AI Agent 本地渲染精美 Mermaid 图,无需浏览器 — tom_doerr · 2026-09-21
- 把税务文件凭证交给 AI 助手:好用但令人不安 — zeeg · 2026-09-21
- 编码 agent AdaL 招募 10 名免费用户,求最狠批评 — Zachly · 2026-09-21
- 开发者自建 Grok Bot「anew」,把 AI 机器人接成免费网页服务 — round · 2026-09-21
- JevArena 开源:盲测对比各模型当 AI 评委的水平与成本 — richie9830 · 2026-09-21