Grok 4.5 在 2000 个职场任务基准上拿下第一
XFreeze · x · 2026-07-21
Grok 4.5 在职场任务基准上领先 GPT 5.5 和 Claude Opus 4.8
Snorkel AI 用 近 2000 个专家设计的真实职场任务测试了 Grok 4.5 + Grok Build,对比对象是 GPT 5.5 和 Claude Opus 4.8。任务覆盖真实文档、表格、演示文稿和专业分析。
- Grok 4.5 总体第一。
- 在几个高判断门槛领域优势更大:
- 教育:58%
- 法律工作:40%
- 质量保证:37%
- 医疗:35%
- Snorkel 还称,Grok 在其统计的所有错误类别里都拥有最低失败率,包括:
- 漏分析
- 建议错误
- 结构不佳
- 缺少来源
这条帖子的核心不是“做完了更多任务”,而是 Grok 产出了更像专业交付物的结果,更少关键错误,也给出了更具体、可执行的建议。
「模型」频道最新
- NVIDIA 称 Nemotron 3 Ultra 在 2026 IMO 上拿到 30/42 — NVIDIAAI · 2026-07-22
- OpenAI 传将向美国政界简报下一代模型家族 — kimmonismus · 2026-07-22
- Muse Spark 1.1 在 Text Arena 跑到 1495 分,性价比很突出 — ycombinator · 2026-07-22
- 教授提醒:最先进的大模型正变得无法相互替代 — emollick · 2026-07-22
- 实测吐槽谷歌 Gemini 全家桶:无一款模型能胜任核心工作负载 — bindureddy · 2026-07-22
- 曝某模型支持百万 token 上下文,价格低至 $0.33 — MickeySteamboat · 2026-07-22