Grok 4.5 在 2000 个职场任务基准上拿下第一

XFreeze · x · 2026-07-21

Grok 4.5 在职场任务基准上领先 GPT 5.5 和 Claude Opus 4.8

Snorkel AI 用 近 2000 个专家设计的真实职场任务测试了 Grok 4.5 + Grok Build,对比对象是 GPT 5.5 和 Claude Opus 4.8。任务覆盖真实文档、表格、演示文稿和专业分析。

这条帖子的核心不是“做完了更多任务”,而是 Grok 产出了更像专业交付物的结果,更少关键错误,也给出了更具体、可执行的建议。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →