Grok 4.6 夺冠银行业 Agent 工具基准测试
XFreeze · x · 2026-08-23
Grok 4.6 在 Artificial Analysis 更新的 τ³-Banking 基准测试中登顶榜首。该测试旨在评估 AI 模型在智能体工具使用场景下的能力,要求模型在 700 份相互关联的银行政策文档中导航,理解客户问题并推理规则,最终通过正确的工具调用序列完成实际任务。测试涵盖争议处理、账户冻结、信用额度调整、产品变更及多步客户请求等真实工作流,评分完全基于任务是否实际正确完成。
「模型」频道最新
- 实测对比:Grok 频繁出错,Sol 挑战假设能力更强 — jdjohnson · 2026-08-23
- 国产 flash 模型被指思考过久,体验卡顿严重 — oran_ge · 2026-08-23
- 实验计划:Mac 本地跑 Qwen 模型对抗云端安全扫描 — natesiggard · 2026-08-23
- 英伟达发布 5500 亿参数指令跟随教师模型 — huggingface · 2026-08-23
- 视频:一个简单提示词暴露 Claude 的「暗面」 — Memetic1 · 2026-08-23
- 爆料:Gemini 3.5 Pro 或已取消,Google 员工开始预热 Gemini 4 — haider1 · 2026-08-23