Grok 4.5 领跑多项专业基准测试
根据 Artificial Analysis 发布的最新 AI 知识工作基准结果,Grok 4.5 展现出了强大的专业领域实力,成为目前表现最好的非 Anthropic 模型。这一成绩引起了 AI 社区的关注,证明了其在复杂任务中的竞争力。
关键细节
Grok 4.5 在多项专业工作基准测试中取得了领先成绩。据 @kevinnbass 总结,该模型的分数显著优于 Opus 4.8 和 GPT 5.5 等其他前沿模型。@XFreeze 的详细数据指出,Grok 4.5 拿下了多个细分榜单的第一名,包括 AutomationBench-AA、Terminal-Bench v2、Harvey Legal Agent Benchmark、SWE Marathon 和 SWE-Atlas 等。
优势领域
多位作者均特别强调了 Grok 4.5 在法律任务上的卓越表现。无论是在综合评价还是具体的 Harvey Legal Agent Benchmark 中,该模型都展现出了处理专业法律工作的突出能力。
2026-07-10 ~ 2026-07-10 · 5 条相关
- 第 1 集:马斯克官宣Grok 4.5发布,1.5万亿参数强化编码(2026-07-07,25 条)
- 第 2 集:预测市场高度押注Grok 4.4近期发布(2026-07-07,2 条)
- 第 3 集:Grok 4.5 发布主打编程与低价(2026-07-08,61 条)
- 第 4 集:xAI发布Grok 4.5:主打编程与智能体,对标Opus(2026-07-09,55 条)
- 第 5 集:Grok 4.5 发布获大量好评:速度快、编码强(2026-07-09,13 条)
- 第 6 集:Grok 4.5发布并登上Vals榜单第六名(2026-07-09,2 条)
- 第 7 集:Grok 4.5 模型正式接入 Notion(2026-07-09,2 条)
- 第 8 集:马斯克称Grok 4.5兼具高性能与低门槛(2026-07-09,3 条)
- 第 9 集:Grok 4.5 领跑多项专业基准测试(2026-07-10,5 条)
- 第 10 集:Grok 4.5登顶编码基准且Token消耗极低(2026-07-10,3 条)
- 第 11 集:Grok 4.5 开放免费试用并接入开发工具(2026-07-10,9 条)
- 第 12 集:Grok 4.5 接入 Perplexity 编排系统并登顶 WANDR 评测(2026-07-11,10 条)
- 第 13 集:Grok 4.5编码能力大幅提升,执行明确任务速度极快(2026-07-11,2 条)
- 第 14 集:Grok 4.5 评测:中高预算段性价比突出(2026-07-11,5 条)
- 第 15 集:Grok 4.5 体验获好评:速度亮眼跻身顶级梯队(2026-07-11,2 条)
- 第 16 集:Grok 4.5 首批实测:更快更省,杀入编程工作流(2026-07-12,8 条)
- 第 17 集:马斯克称 Grok 4.5 部分编程测试胜过 Fable(2026-07-13,3 条)
- 第 18 集:Grok 4.5登顶代码问答榜并推出联合共建版(2026-07-13,3 条)
- 第 19 集:Grok 4.5因速度领先受关注(2026-07-14,2 条)
- 第 20 集:Grok 4.5 聚焦编程与代理工作流(2026-07-15,12 条)
一手来源
- Grok 4.5 登顶新基准 — Polymarket ·
- Grok 4.5 多榜单登顶 — XFreeze ·
- Grok 4.5 基准分数领先 — kevinnbass ·
- 【源头】Grok 4.5 多榜单登顶 — XFreeze · 2026-07-10
- 【源头】Grok 4.5 登顶新基准 — Polymarket · 2026-07-10
- 【源头】Grok 4.5 基准分数领先 — kevinnbass · 2026-07-10
另有 2 条近重复转述:kevinnbass · kevinnbass