腾讯发布 GameXpert-Bench,评测智能体游戏开发全流程能力
Tencent-Hunyuan · hf · 2026-08-25
腾讯发布 GameXpert-Bench,旨在评估编码智能体在游戏开发领域的专业能力。该基准涵盖了游戏开发的三个关键阶段:生成、修复和优化。通过交互式和行为测试,结果显示智能体在构建可玩基础方面表现较强,但在缺陷发现和回归保留方面存在弱点。
「编程与Agent」频道最新
- 长周期 Agent 开发痛点:时间紧来不及跑完完整流程 — agihouse_org · 2026-08-25
- AGI House 黑客松反思:长周期 Agent 需要验证而非记忆 — agihouse_org · 2026-08-25
- Terminal-Bench 3.0 发布:顶级模型分暴跌,Agent 只会修补症状 — ajratner · 2026-08-25
- Spine-Branch 框架:多 Agent 协作提升成功率 16.5% — ZhiyuChen4 · 2026-08-25
- Claude 官方晒神作:从 3D 医学影像查看到可步行街道的代码创意 — 机器之心 · 2026-08-25
- AI 智能体应具备四种记忆类型以模拟人类能力 — _jaydeepkarale · 2026-08-25