Harvey 法律评测:GPT-6 Astra 得分最高,但输出 token 量与成绩无关

ArtificialAnlys · x · 2026-10-09

Artificial Analysis 联合法律 AI 公司 Harvey 发布 LAB-AA 评测(Harvey LAB 法律数据集),并有 Harvey 官方对评测与人类专家偏好的评论。

一个反直觉发现:生成更多输出 token 并不等于更高分——GPT-6 Astra (max) 每任务输出约 81k token、得分 8.6%,不到 Grok 4.7 (xhigh) 约 180k token 的一半;三个 Claude 模型输出最多(每任务约 202k562k),得分反而只有 2.8%6.4%。

所属事件:幻觉门控改写法律基准排名,Grok 4.7 登顶(8 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →