Grok 4.6 金融尽调基准并列第二,单任务成本仅 0.84 美元
karinanguyen · x · 2026-08-19
对 Grok 4.6 在深度金融研究任务上的实测:
- DiligenceBench(金融 harness)上排名 #2,成绩约 52–53%,与 Claude Opus 5 基本持平;Sonnet 5 落后,为 46.2%
- 工作方式差异明显:Grok 平均每任务 41 次工具调用 vs Opus 的 22 次;SEC 文件检索 3,293 次 vs 486 次——更广的搜索帮它找到更多证据、更贴合任务指令,Opus 则更高效、有时更细腻
- 成本更低:约 $0.84/任务 vs Opus 5 的 $1.02,尽管搜索量远大于对方
- 在 Vals 的 Finance Agent Benchmark v2(FAB v2)上,Grok 4.6 领跑 General Qualitative 类别,与 DiligenceBench 奖励的广泛取证型研究风格一致
所属事件:Grok 4.6 列 DiligenceBench 第二,与 Opus 5 统计打平(2 条相关)→
「模型」频道最新
- Qwen 3.8 两版本推理能力对比:Q4 反超 Q5 — k-r-a-u-s-f-a-d-r · 2026-08-19
- GLM-5.3 评分 60 追平 Kimi K3,将开放权重 — ArtificialAnlys · 2026-08-19
- Gemini 生图在 Hetzner 服务器静默失败,元凶竟是数据中心 IP — dota2dinall · 2026-08-19
- GLM-5.3 评测指数达 60 分,仍是中国最强模型之一 — teortaxesTex · 2026-08-19
- DFlash 2 现已支持 Qwen 3.8 27B 与 Muse Glimmer — rerri · 2026-08-19
- Codex 新版破坏 subagents,回退 0.142.0 可规避 — chibop1 · 2026-08-19