字节跳动EdgeBench:评测AI智能体长达十小时的自我迭代能力

karminski3 · x · 2026-07-06

字节跳动Seed团队发布EdgeBench评测框架,专为考察AI智能体在真实可运行环境中长程(十数小时)自主迭代与改进的能力而设计,不同于单次任务评测,重点衡量智能体能否利用环境反馈、根据失败调整策略并持续提升表现。

测试者使用本地运行的35B-A3B模型(4bit量化),挑战经典Roguelike游戏DCSS命令行版本:任务是让Agent通过CodeX CLI编写Lua脚本Bot,在约70分钟内自动探索、战斗和下层。初始自动评分15.2分,经多轮迭代最高提升至33.4分,清晰展现了AI在长程任务中的真实学习轨迹。

所属事件:字节发布EdgeBench评测Agent长程迭代能力(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →