马斯克转发:Grok 4.7 法律 Agent 基准得分 19.6%,约三倍于对手

elonmusk · x · 2026-09-22

马斯克转发了一条关于 Grok 4.7 在 Legal Agent Benchmark(法律智能体基准)上表现的推文:该模型在真实、长期法律任务上得分 19.6%,超过了所有被测模型,接近对比模型 Fable 5.1 的三倍。

需要注意这是第三方账号的说法,19.6% 的绝对分值也说明此类长期任务仍然很难;具体评测细节有待官方或独立复现。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →