腾讯混元推 E-Bench:真实场景多步工具调用,最强大模型成功率不足 74%

腾讯混元 · wechat · 2026-08-03

腾讯混元联合清华 AIR 与东南大学推出智能体评测基准 E-Bench,旨在测试大模型在真实产品场景下的多步骤工具调用能力。

基准设计与核心机制

评测结果与关键洞察

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →