马斯克转发:Grok 4.7 法律 Agent 基准得分 19.6%,约三倍于对手
elonmusk · x · 2026-09-22
马斯克转发了一条关于 Grok 4.7 在 Legal Agent Benchmark(法律智能体基准)上表现的推文:该模型在真实、长期法律任务上得分 19.6%,超过了所有被测模型,接近对比模型 Fable 5.1 的三倍。
需要注意这是第三方账号的说法,19.6% 的绝对分值也说明此类长期任务仍然很难;具体评测细节有待官方或独立复现。
「模型」频道最新
- 让两大前沿模型操纵真实机器人玩夺旗,Gemini 以 70% 胜率碾压对手 — chris_j_paxton · 2026-09-22
- 实测评测:105 个植入 bug 下 Grok 4.7 仅 28.7 分,不敌 GPT-6 — PawelHuryn · 2026-09-22
- 对 OpenAI GPT-5.6 发布页三个基准做回归,反推其 λ 取值 — tobyordoxford · 2026-09-22
- 13 小时烧掉 14.6 亿 Jev tokens,$5 额度被这么玩 — MaziyarPanahi · 2026-09-22
- 分析OpenAI曲线:算力投入多智能体集群,得分增益仅为延长思维链的一半 — tobyordoxford · 2026-09-22
- 用户实测:Gemini 4 Pro 线上版和跑分版不是同一个模型 — Ambroverse · 2026-09-22