Snorkel 职业能力评测:Grok 4.5 在 16 项中拿下 14 项第一

XFreeze · x · 2026-07-30

Snorkel 对比了主流大模型在真实职业场景下的表现。结果显示 Grok 4.5 在展示的 16 个职业类别中拿下了 14 项最高平均通过率(12 项绝对领先,2 项并列第一),击败了 GPT-5.5 和 Claude Opus 4.8。

该优势不仅限于编程领域,在法律、医疗、金融、教育和制造业等专业任务中,Grok 4.5 均展现出更广泛的通用智能。报告指出,它在专业交付物质量上更高,在所有六个追踪类别中错误更少,并能提供比竞品更具体、可落地的建议。这再次印证了真实世界的工作产出比单纯的榜单分数更重要。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →