字节发布EdgeBench:衡量Agent真实环境学习能力
字节跳动Seed · wechat · 2026-07-07
字节跳动Seed团队发布超长程评测集EdgeBench,专门衡量Agent在真实世界环境中持续学习、不断变强的能力。该评测集含134个真实多样的任务,横跨科学、复杂软件工程、白领知识工作、算法优化、前沿数学和数字游戏六大领域;每个任务支持Agent连续工作至少12小时(部分延长实验超72小时),由领域专家结合真实问题迭代,超90%为全新构建。人类专家完成单个任务平均需57.2小时,最高达320小时。
团队基于约38000小时环境交互记录发现:Agent在环境学习中的整体表现遵循一条高精度的log-sigmoid曲线,平均拟合精度R²达0.998,可从图探索理论角度解释;从不同代际前沿模型看,Agent学习速度大致每三个月翻一倍。不同任务的学习路径各异——有的稳步提升,有的前期快速进步后进入平台期,也有的在长时间停滞后才迎来突破。
目前已开源其中51个任务及完整评测框架,供社区研究Agent如何从真实环境学习。项目、论文、代码与数据均已公开。
所属事件:字节发布EdgeBench评测Agent长程迭代能力(4 条相关)→
「编程与Agent」频道最新
- alphaXiv 开源 OpenResearch:用任意模型并行跑研究智能体 — alphaXiv · 2026-09-11
- MathModelAgent 走红:自动完成数学建模并生成可提交论文 — jihe520 · 2026-09-11
- 开源 AI 销售 OS DeskcommCRM 爆火:自带 Agent 与 WhatsApp 集成 — melgarafael · 2026-09-11
- hyperresearch 开源:让 Agent 把网络调研沉淀为可搜索知识库 — jordan-gibbs · 2026-09-11
- Forter 两周全员 Agent 冲刺 13 条经验:跳过自建 RAG 靠企业搜索 — bibryam · 2026-09-11
- 拆解两款真实「公司大脑」:Slite 与 Gorgias 同台对比构建之道 — femke_plantinga · 2026-09-11