Grok 4.6 登 DiligenceBench 榜第二,与 Opus 5 统计打平

karinanguyen · x · 2026-08-19

DiligenceBench 是 Paper Instruments 与 Thoughtful Lab 联合发布的股票研究 agent 评测基准,含 150 个开放式尽调任务,覆盖能源、银行、生物科技、保险、科技、REITs、餐饮、工业与公用事业 10 个行业、143 家公司、5,428 条评分标准,考察事实准确性、分析推理与风险意识,要求 agent 检索外部 SEC 文件并计算作答,而非靠记忆。

Grok 4.6 以 53.2 分进入 Finance harness 榜单第二名,仅高于 Claude Opus 5(52.1)1.1 分,95% 置信区间为 −1.0 至 +3.2,二者应视为统计上打平而非 Grok 决定性胜出。

行为差异很有意思:Grok 每任务平均 41 次工具调用(Opus 为 22),SEC 文件检索 3,293 次(Opus 仅 486 次),更广的搜索帮助 Grok 找到更多证据并更好地遵循任务指令。作者(Karina Nguyen)认为该基准已部分捕捉推理时扩展(H1→H3 提供更强工具与工作流),但业界还需要更多评测来理解性能随算力、搜索与工具使用的扩展规律。

所属事件:Grok 4.6 列 DiligenceBench 第二,与 Opus 5 统计打平(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →