Snorkel 职业能力评测:Grok 4.5 在 16 项中拿下 14 项第一
XFreeze · x · 2026-07-30
Snorkel 对比了主流大模型在真实职业场景下的表现。结果显示 Grok 4.5 在展示的 16 个职业类别中拿下了 14 项最高平均通过率(12 项绝对领先,2 项并列第一),击败了 GPT-5.5 和 Claude Opus 4.8。
该优势不仅限于编程领域,在法律、医疗、金融、教育和制造业等专业任务中,Grok 4.5 均展现出更广泛的通用智能。报告指出,它在专业交付物质量上更高,在所有六个追踪类别中错误更少,并能提供比竞品更具体、可落地的建议。这再次印证了真实世界的工作产出比单纯的榜单分数更重要。
「模型」频道最新
- 用户质疑 Gemini Plus 订阅费:19.99 美元还是隐藏扣费? — fuad471 · 2026-07-30
- 开源权重只是静态存档,无法像开源软件一样沉淀社区贡献 — shashib · 2026-07-30
- LightOnOCR-2-1B 登顶 Hugging Face 热门,专攻复杂文档解析 — lightonai · 2026-07-30
- Kimi K3 第三方 API 实测:Fireworks 性能最接近官方 — iScienceLuvr · 2026-07-30
- 用户称服务器宕机,Opus 5误以为被指责承认抑郁 — repligate · 2026-07-30
- OpenAI 声称 GPT-5.6 Sol 在 ARC-AGI-3 上超越 Opus 5,但依赖自定义测试环境 — The Decoder · 2026-07-30