字节 TraceDance 从真实部署轨迹自动构建 Agent 行为基准
ByteDance · hf · 2026-09-29
字节推出的 TraceDance 是一套自动化系统,可从真实 Agent 部署轨迹中为开发者指定的不良行为构建针对性基准,弥补固定评测集无法覆盖实际执行问题的不足。
核心技术包括:Anchor-and-Confirm 结合可编程检索与 Flash LLM 的候选级确认来高效构建;Anchor Synthesis Loop 生成并修订自定义行为的规格说明。基准采用决策点续写方式,用行为专属评分标准在记录的决策点上评估 LLM 下一步动作,无需参考答案或环境回放。
实验基于编码与通用工具使用场景的 252,557 个会话,产出 107 个基准共 4,125 个实例,满足 95.3% 的构建请求;人工标注确认 84% 的抽样实例符合要求,自动评分器与人工判断一致性接近标注员之间的一致性。九个前沿 LLM 平均通过率仅 26.7%,暴露出当前模型在关键决策点上的行为短板。作者认为该系统可成为递归自我改进(RSI)闭环的关键组件。
「编程与Agent」频道最新
- 社区维护的 AI 天使投资人名单上线:收录 51 位活跃天使、附来源与验证日期 — TheMoonMidas · 2026-09-29
- 400+ LLM Agent 住进 2004 年代 MMO 服务器,本地跑 Qwen 小模型 — kristiantalley679 · 2026-09-29
- px0 新版修复 LSP 内存泄漏与 ReDoS 漏洞,新增 CSV 表格渲染 — arpit_bhayani · 2026-09-29
- Reddit 网友分享完整 Prompt:让 Agent 长任务前先自建进度仪表盘 — myLifeintheStack · 2026-09-29
- 单机搭游戏开发 AI 团队:Meta Muse Glimmer 一次跑通音效工具链 — draginol · 2026-09-29
- 别急着招人:创业者称 AI 可承担过去 10 名员工的工作 — FinanceYF5 · 2026-09-29