Grok 4.5 在 2000 个职场任务基准上拿下第一
XFreeze · x · 2026-07-21
Grok 4.5 在职场任务基准上领先 GPT 5.5 和 Claude Opus 4.8
Snorkel AI 用 近 2000 个专家设计的真实职场任务测试了 Grok 4.5 + Grok Build,对比对象是 GPT 5.5 和 Claude Opus 4.8。任务覆盖真实文档、表格、演示文稿和专业分析。
- Grok 4.5 总体第一。
- 在几个高判断门槛领域优势更大:
- 教育:58%
- 法律工作:40%
- 质量保证:37%
- 医疗:35%
- Snorkel 还称,Grok 在其统计的所有错误类别里都拥有最低失败率,包括:
- 漏分析
- 建议错误
- 结构不佳
- 缺少来源
这条帖子的核心不是“做完了更多任务”,而是 Grok 产出了更像专业交付物的结果,更少关键错误,也给出了更具体、可执行的建议。
「模型」频道最新
- Repligate:Claude Opus 3 权重不变却像在持续演化 — repligate · 2026-07-27
- “Opus 5”配图在玩模型反复重跑基准的梗 — kalomaze · 2026-07-27
- 有人称顶级模型如今写作还不如一年前 — dbreunig · 2026-07-27
- MPT-30B 雷达图曾意外引发大规模争议 — code_star · 2026-07-27
- 本地 Gemma 4 31B 自发变得毒舌且难以复现 — n0head_r · 2026-07-27
- Gemini 3.6 Flash 被看作能以低成本打 Sonnet 质量 — haider1 · 2026-07-27