Grok 4.5 职业任务基准领先
elonmusk · x · 2026-07-10
Snorkel 的新数据显示,Grok 4.5 在真实职业任务基准 GDPval+ 上领先其他前沿模型。该基准覆盖经济各领域的专家设计工作任务,Grok 4.5 的平均通过率为 29%,高于 GPT 5.5 的 22% 和 Claude Opus 4.8 的 21%。
帖子还指出,Grok 4.5 在法律、教育、医疗和 QA 分析等要求更高的场景里提升明显,体现出 xAI 更强调模型在真实、可执行工作中的表现。
「模型」频道最新
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 实测找 105 个隐藏 bug:DeepSeek V4.1 Flash 得 24 分,成本仅 Opus 5 的 3.5% — ChartsJournalX · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11
- Nex N2.5 Pro 开源发布,权重体积达 407GB — jinnyjuice · 2026-09-11