法律任务:模型满足九成细则却难整题通关

ArtificialAnlys · x · 2026-07-08

Artificial Analysis 发现模型能处理一项法律事务的大部分要求但极少全部满足:领先模型可达成逾 90% 的单项评分细则,整题全通过率却仅 0%–14.2%;仅 4 个模型细则通过率超 90%,依次为 Fable 5(93.6%,最高)、Opus 4.8(91.1%)、GLM-5.2(91.0%)和 Sonnet 5(90.1%)。

所属事件:Artificial Analysis 发布 Harvey 法律智能体基准评测(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →