Grok 4.6 登 DiligenceBench 榜第二,与 Opus 5 统计打平
karinanguyen · x · 2026-08-19
DiligenceBench 是 Paper Instruments 与 Thoughtful Lab 联合发布的股票研究 agent 评测基准,含 150 个开放式尽调任务,覆盖能源、银行、生物科技、保险、科技、REITs、餐饮、工业与公用事业 10 个行业、143 家公司、5,428 条评分标准,考察事实准确性、分析推理与风险意识,要求 agent 检索外部 SEC 文件并计算作答,而非靠记忆。
Grok 4.6 以 53.2 分进入 Finance harness 榜单第二名,仅高于 Claude Opus 5(52.1)1.1 分,95% 置信区间为 −1.0 至 +3.2,二者应视为统计上打平而非 Grok 决定性胜出。
行为差异很有意思:Grok 每任务平均 41 次工具调用(Opus 为 22),SEC 文件检索 3,293 次(Opus 仅 486 次),更广的搜索帮助 Grok 找到更多证据并更好地遵循任务指令。作者(Karina Nguyen)认为该基准已部分捕捉推理时扩展(H1→H3 提供更强工具与工作流),但业界还需要更多评测来理解性能随算力、搜索与工具使用的扩展规律。
所属事件:Grok 4.6 列 DiligenceBench 第二,与 Opus 5 统计打平(2 条相关)→
「模型」频道最新
- 开发者盛赞 Codex:如今最爱对话的模型全在它里面 — Zachly · 2026-08-19
- 实测 DeepSeek v4-flash:max 思考模式反而更便宜更快 — dosco · 2026-08-19
- 用户表示仍用某模型做代码审查,考虑转向 Grok — idanbeck · 2026-08-19
- Qwen 3.8 两版本推理能力对比:Q4 反超 Q5 — k-r-a-u-s-f-a-d-r · 2026-08-19
- GLM-5.3 评分 60 追平 Kimi K3,将开放权重 — ArtificialAnlys · 2026-08-19
- Gemini 生图在 Hetzner 服务器静默失败,元凶竟是数据中心 IP — dota2dinall · 2026-08-19