上交等提出Agent审计引擎:同模型不同框架,Token消耗相差近10倍
alex_verem · x · 2026-08-10
上海人工智能实验室等机构发布了论文《An End-to-End Agent Auditing Engine》($A^2E$),这是一个针对智能体框架的端到端评估引擎。
- 核心机制:通过新提出的 Agent Task Protocol (ATP) 快速集成评估任务,并使用 Monitor 自动捕获标准化执行轨迹,从执行效率、工具使用、任务规划和错误恢复等多维度评估框架能力。
- 关键发现:在相同底层模型和任务下,不同框架表现差异巨大。例如 LangGraph 仅用 10,122 tokens 就解决了任务,而 CrewAI 消耗了 96,704 tokens(高出 9.6 倍)且依然失败。
- 研究结论:各框架的最终准确率相差不大,但 Token 成本差距高达 3.5 倍,且没有任何单一框架能在所有任务类型中始终保持领先。这表明模型之外的脚手架代码对智能体表现至关重要。
所属事件:上交等推出Agent审计引擎,实测9大框架Token消耗相差近10倍(2 条相关)→
「编程与Agent」频道最新
- 如何为团队构建共享的 AI 底座,打破工具与上下文孤岛 — VibeMarketer_ · 2026-08-10
- YC 掌门人:AI 杠杆在上下文而非模型,个人产出暴增 400 倍 — Roger_M_Taylor · 2026-08-10
- 为 Markdown 笔记应用内置 MCP 服务器,默认关闭写入 — Eerie-echoes · 2026-08-10
- LiquidAI 开发者指南:涵盖多模态模型微调方法 — helloiamleonie · 2026-08-10
- Hugging Face 长文:2026 前沿模型的强化学习后训练演进史 — SergioPaniego · 2026-08-10
- ComfyUI工作流变身AI代理技能,支持OpenClaw、Codex等 — tom_doerr · 2026-08-10