法律评测:全通过率与单任务 token 产出正相关

ArtificialAnlys · x · 2026-07-08

Artificial Analysis 指出模型全通过率通常与单任务工作量挂钩:Fable 5 单任务生成约 11.7 万输出 token 达到 14.2% 全通过;Opus 4.8 与 GLM-5.2 分别约 11.1 万、7.8 万 token 达到 7.5%;Sonnet 5 单任务生成约 17.9 万 token,为本次评测产出最多,却只达到 5.0%。

所属事件:Artificial Analysis 发布 Harvey 法律智能体基准评测(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →