幻觉门控改写法律基准排名,Grok 4.7 登顶

Artificial Analysis 与法律 AI 公司 Harvey 联合发布法律 Agent 基准 LAB-AA 方法更新 v1.1,核心变化是新增幻觉门控:只有当模型交付物满足全部评分标准、且不含「实质性幻觉」时,才计入头条指标 Hallucination-Gated 分数。幻觉门控引入后多数模型排名大洗牌,Grok 4.7 登顶,而门控前排名第一的 Meta Muse Spark 1.3 (max) 从 26.7% 跌至 8.9%,超六成合格结果被发现含有实质性幻觉。这一指标凸显了法律场景下「完成任务」与「不出错」是两种独立能力。

已确认

为什么重要

2026-10-09 ~ 2026-10-09 · 8 条相关

一手来源