AutoWorldModel-Bench:评估自主编码智能体的新基准

Marjan Moodi · hf · 2026-08-13

AutoWorldModel-Bench 是一个以状态为中心的全新基准测试。它通过让自主编码智能体在游戏环境中,利用共享的结构化状态格式迭代改进初始模型,来评估这些智能体在开放式世界模型研究中的表现。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →