别只卷模型了!实测9大Agent框架,Token消耗最多相差近10倍

alex_verem · x · 2026-08-10

上海人工智能实验室等机构开发了 Agent 审计引擎($A^2E$),在 23 个基准测试中对 9 种主流智能体框架进行了横向评测。测试中所有框架均接入同一个底层模型,以排除模型能力差异,纯粹考察框架层的调度与提示词管理能力。

实验揭示了一个反直觉的现象:决定智能体表现的关键往往不是模型本身,而是外围的框架包装层。在相同任务下,LangGraph 仅用 10,122 tokens 就成功通关,而 CrewAI 消耗了 96,704 tokens(成本高出 9.6 倍)却依然失败,原因是 CrewAI 陷入了无效的重启循环。

整体数据显示,各框架的最终准确率相差不大,但 Token 开销差距高达 3.5 倍,且没有任何框架能在所有任务类型中通吃。如果你的智能体运行缓慢、昂贵或陷入死循环,或许该优先排查框架层而非模型层。

所属事件:上交等推出Agent审计引擎,实测9大框架Token消耗相差近10倍(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →