Grok 4.5 领跑多项专业基准测试

根据 Artificial Analysis 发布的最新 AI 知识工作基准结果,Grok 4.5 展现出了强大的专业领域实力,成为目前表现最好的非 Anthropic 模型。这一成绩引起了 AI 社区的关注,证明了其在复杂任务中的竞争力。

关键细节

Grok 4.5 在多项专业工作基准测试中取得了领先成绩。据 @kevinnbass 总结,该模型的分数显著优于 Opus 4.8 和 GPT 5.5 等其他前沿模型。@XFreeze 的详细数据指出,Grok 4.5 拿下了多个细分榜单的第一名,包括 AutomationBench-AA、Terminal-Bench v2、Harvey Legal Agent Benchmark、SWE Marathon 和 SWE-Atlas 等。

优势领域

多位作者均特别强调了 Grok 4.5 在法律任务上的卓越表现。无论是在综合评价还是具体的 Harvey Legal Agent Benchmark 中,该模型都展现出了处理专业法律工作的突出能力。

2026-07-10 ~ 2026-07-10 · 5 条相关

事件全程(共 20 集)→

一手来源

另有 2 条近重复转述:kevinnbass · kevinnbass