Artificial Analysis 发布 Harvey 法律智能体基准评测
Artificial Analysis 独立复现并发布了 Harvey 法律智能体基准(LAB-AA)的完整评测结果,旨在评估语言模型在覆盖 24 个执业领域的真实法律工作上的表现。该基准揭示了当前顶尖模型在复杂法律任务中的能力边界与高昂算力成本。
评测机制与核心难点
此次复现版 LAB-AA 运行在 Artificial Analysis 自研的 Stirrup agent harness 上,支持上下文压缩,并使用了简化的自编 agent。评测发现,法律任务对智能体的综合能力要求极高:领先模型虽然能达成逾 90% 的单项评分细则(仅 Fable 5、Opus 4.8、GLM-5.2 等 4 个模型做到),但极少能全部满足整题要求,整题全通过率仅在 0%–14.2% 之间。
成绩榜单与性价比分析
在具体排名上,Claude Fable 5 以 14.2% 的全通过率领跑,但登顶成本极为高昂,单任务约 18.9 美元,高于 Sonnet 5 的约 11.8 美元。相比之下,GLM-5.2 展现出最优的性价比。此外,模型的全通过率通常与单任务工作量挂钩:Fable 5 单任务生成约 11.7 万输出 token 达到 14.2% 全通过;Opus 4.8 与 GLM-5.2 分别约 11.1 万、7.8 万 token。
智能体行为特征分析
数据表明,长程智能体循环已成为顶级模型在复杂任务上的重要特征。在智能体长循环任务中表现领先的模型普遍运行了更多轮次:Fable 5 平均每任务约 64 轮,Opus 4.8、GLM-5.2、MiniMax-M3 紧随其后。同时,更强的模型倾向在每个任务上花费更长时间,例如 Fable 5 平均约 16.9 分钟/任务,Opus 4.8 约 18.5 分钟,Sonnet 5 约 22.8 分钟。
2026-07-08 ~ 2026-07-08 · 8 条相关
一手来源
- Artificial Analysis 发布 Harvey 法律智能体基准 — ArtificialAnlys ·
- Fable 5 登顶法律评测,GLM-5.2 性价比最优 — ArtificialAnlys ·
- Artificial Analysis 独立复现 Harvey 法律评测 — ArtificialAnlys ·
- 【源头】Artificial Analysis 发布 Harvey 法律智能体基准 — ArtificialAnlys · 2026-07-08
- 法律任务:模型满足九成细则却难整题通关 — ArtificialAnlys · 2026-07-08
- 【源头】Fable 5 登顶法律评测,GLM-5.2 性价比最优 — ArtificialAnlys · 2026-07-08
- 法律评测:全通过率与单任务 token 产出正相关 — ArtificialAnlys · 2026-07-08
- 更强模型在智能体任务上耗时更长 — ArtificialAnlys · 2026-07-08
- 长程智能体循环成顶级模型特征 — ArtificialAnlys · 2026-07-08
- 【源头】Artificial Analysis 独立复现 Harvey 法律评测 — ArtificialAnlys · 2026-07-08
- Harvey 公布法律智能体基准成绩 — ArtificialAnlys · 2026-07-08