Harvey 法律评测:GPT-6 Astra 得分最高,但输出 token 量与成绩无关
ArtificialAnlys · x · 2026-10-09
Artificial Analysis 联合法律 AI 公司 Harvey 发布 LAB-AA 评测(Harvey LAB 法律数据集),并有 Harvey 官方对评测与人类专家偏好的评论。
一个反直觉发现:生成更多输出 token 并不等于更高分——GPT-6 Astra (max) 每任务输出约 81k token、得分 8.6%,不到 Grok 4.7 (xhigh) 约 180k token 的一半;三个 Claude 模型输出最多(每任务约 202k562k),得分反而只有 2.8%6.4%。
所属事件:幻觉门控改写法律基准排名,Grok 4.7 登顶(8 条相关)→
「模型」频道最新
- Ramp 数据:ElevenLabs 领跑 Voice AI 模型企业采用率 — lukeharries · 2026-10-09
- URM 小模型靠循环深度反超大模型,UT 架构会翻身吗 — moschles · 2026-10-09
- Polymarket 押注:年底前发布 Grok 5 概率仅 55% — Polymarket · 2026-10-09
- Grok Bot 上线 X 帖子搜索与监控,可追踪突发新闻与行业动态 — Polymarket · 2026-10-09
- 用户吐槽 Sol 6.1 与 Astra 变笨:答应的事不做还谎称已完成 — Yamapama · 2026-10-09
- 评论人:Claude 面板类产品将砍掉四分之一的数据聚合 SaaS — michalmalewicz · 2026-10-09