字节跳动EdgeBench:评测AI智能体长达十小时的自我迭代能力
karminski3 · x · 2026-07-06
字节跳动Seed团队发布EdgeBench评测框架,专为考察AI智能体在真实可运行环境中长程(十数小时)自主迭代与改进的能力而设计,不同于单次任务评测,重点衡量智能体能否利用环境反馈、根据失败调整策略并持续提升表现。
测试者使用本地运行的35B-A3B模型(4bit量化),挑战经典Roguelike游戏DCSS命令行版本:任务是让Agent通过CodeX CLI编写Lua脚本Bot,在约70分钟内自动探索、战斗和下层。初始自动评分15.2分,经多轮迭代最高提升至33.4分,清晰展现了AI在长程任务中的真实学习轨迹。
所属事件:字节发布EdgeBench评测Agent长程迭代能力(4 条相关)→
「编程与Agent」频道最新
- 一个 MCP 服务器把 AI agent 每次工具调用都签进可验证 Merkle 链 — Funky_Chicken_22 · 2026-07-22
- Claude Code 团队访谈逐字稿已整理公开 — trq212 · 2026-07-22
- 10 条 Markdown 规则把 Claude Code 改成 ADHD 友好输出 — alex_verem · 2026-07-22
- BUZZ 发布开源群聊平台,主打人机团队协作 — Scobleizer · 2026-07-22
- 一个基于 Firecracker 的平台称可在 256 GB 服务器上跑 6000 个 AI agent — maritime_sh · 2026-07-22
- 智能体自治别急着放权,先跑波次找摩擦点 — JnBrymn · 2026-07-22