Grok 4.6 列 DiligenceBench 第二,与 Opus 5 统计打平

在 Paper Instruments 与 Thoughtful Lab 联合发布的金融研究 agent 评测基准 DiligenceBench(含 150 个开放式尽调任务)上,Grok 4.6 以约 52–53% 的成绩与 Claude Opus 5 统计打平并列第二,且单任务成本仅 0.84 美元,展现了在深度金融研究任务上的高性价比。

2026-08-19 ~ 2026-08-19 · 2 条相关