别只卷模型了!实测9大Agent框架,Token消耗最多相差近10倍
alex_verem · x · 2026-08-10
上海人工智能实验室等机构开发了 Agent 审计引擎($A^2E$),在 23 个基准测试中对 9 种主流智能体框架进行了横向评测。测试中所有框架均接入同一个底层模型,以排除模型能力差异,纯粹考察框架层的调度与提示词管理能力。
实验揭示了一个反直觉的现象:决定智能体表现的关键往往不是模型本身,而是外围的框架包装层。在相同任务下,LangGraph 仅用 10,122 tokens 就成功通关,而 CrewAI 消耗了 96,704 tokens(成本高出 9.6 倍)却依然失败,原因是 CrewAI 陷入了无效的重启循环。
整体数据显示,各框架的最终准确率相差不大,但 Token 开销差距高达 3.5 倍,且没有任何框架能在所有任务类型中通吃。如果你的智能体运行缓慢、昂贵或陷入死循环,或许该优先排查框架层而非模型层。
所属事件:上交等推出Agent审计引擎,实测9大框架Token消耗相差近10倍(2 条相关)→
「编程与Agent」频道最新
- 如何为团队构建共享的 AI 底座,打破工具与上下文孤岛 — VibeMarketer_ · 2026-08-10
- YC 掌门人:AI 杠杆在上下文而非模型,个人产出暴增 400 倍 — Roger_M_Taylor · 2026-08-10
- 为 Markdown 笔记应用内置 MCP 服务器,默认关闭写入 — Eerie-echoes · 2026-08-10
- LiquidAI 开发者指南:涵盖多模态模型微调方法 — helloiamleonie · 2026-08-10
- Hugging Face 长文:2026 前沿模型的强化学习后训练演进史 — SergioPaniego · 2026-08-10
- ComfyUI工作流变身AI代理技能,支持OpenClaw、Codex等 — tom_doerr · 2026-08-10