Grok 4.6 夺冠银行业 Agent 工具基准测试

XFreeze · x · 2026-08-23

Grok 4.6 在 Artificial Analysis 更新的 τ³-Banking 基准测试中登顶榜首。该测试旨在评估 AI 模型在智能体工具使用场景下的能力,要求模型在 700 份相互关联的银行政策文档中导航,理解客户问题并推理规则,最终通过正确的工具调用序列完成实际任务。测试涵盖争议处理、账户冻结、信用额度调整、产品变更及多步客户请求等真实工作流,评分完全基于任务是否实际正确完成。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →