腾讯混元推 E-Bench:真实场景多步工具调用,最强大模型成功率不足 74%
腾讯混元 · wechat · 2026-08-03
腾讯混元联合清华 AIR 与东南大学推出智能体评测基准 E-Bench,旨在测试大模型在真实产品场景下的多步骤工具调用能力。
基准设计与核心机制
- 真实场景模拟:基于王者荣耀、QQ音乐、腾讯会议三大真实业务构建全合成虚拟环境,包含 323 个状态修改任务,覆盖 41 张数据库表和超 7.6 万行数据。
- 双鸿沟设计:通过“信息鸿沟”(隐藏全局数据库状态)和“工具鸿沟”(限制被测模型只能使用业务工具)确保任务必须通过多步交互才能完成,防止模型“抄近道”。
- 确定性评测:以操作前后的数据库状态 diff 作为绝对标准,不设部分得分,排除了语义裁判的主观误差。
评测结果与关键洞察
- 可靠性是核心瓶颈:测试了 11 个前沿大模型,平均成功率仅 54.56%;最强模型平均成功率 73.79%,但在连续三次稳定通过(Pass³)的测试中降至 58.82%。
- 代码执行有效但非万能:开放 Python 代码执行能提升计算密集型任务的表现,但对跨步依赖等推理决策任务收益有限,最高 Pass³ 依然低于 70%。
- 成本与能力并重:腾讯混元 Hy3 展现出显著的性价比优势,单任务成本约 $0.053(开启代码后降至 $0.029),但在 E-Bench-Code 上取得了 64.40% 的成绩。
- 过早行动是通病:失败往往不是因为模型不会做,而是未能在信息搜集完整时便草率行动。
「模型」频道最新
- Anthropic 工程师:模型与工具链深度绑定才能榨干性能 — May_F1_ · 2026-08-03
- Surge AI 高管揭示基准测试失效内幕:成本千万美元且普遍污染 — alex_verem · 2026-08-03
- 这三个模型有什么区别? — Clair_Personality · 2026-08-03
- Minimax H3的蒸馏LoRA何时发布? — Character_Title_876 · 2026-08-03
- OpenAI 性价比提升,作者归功于国产大模型施压 — haider1 · 2026-08-03
- 开发者用 Opus 5 一次生成完整 3D 游戏:自带建模与音乐 — draginol · 2026-08-03