幻觉门控改写法律基准排名,Grok 4.7 登顶
Artificial Analysis 与法律 AI 公司 Harvey 联合发布法律 Agent 基准 LAB-AA 方法更新 v1.1,核心变化是新增幻觉门控:只有当模型交付物满足全部评分标准、且不含「实质性幻觉」时,才计入头条指标 Hallucination-Gated 分数。幻觉门控引入后多数模型排名大洗牌,Grok 4.7 登顶,而门控前排名第一的 Meta Muse Spark 1.3 (max) 从 26.7% 跌至 8.9%,超六成合格结果被发现含有实质性幻觉。这一指标凸显了法律场景下「完成任务」与「不出错」是两种独立能力。
已确认
- 排名变化:门控后 Grok 4.7 居首;Muse Spark 1.3 (max) 从门控前 26.7% 的第一名跌至 8.9%。
- 能力分离:满足评测标准与不产生幻觉是两种能力——Kimi K3 (max) 标准通过率高达 93.0%,但平均每任务出现 2.09 次实质性幻觉。
- 检查器选型:在 20 个任务的固定子集、8 个模型的交付物上横评六款幻觉检查器(包括 GPT-6 Sol、GPT-6 Luna、Grok 等),最终选定 GPT-6 Sol (high) 用于生产环境;GPT-6 Sol 查出 470 项问题,远超 Grok 的 219 项。
- 成本帕累托前沿:在门控全通过率>0 的模型中,GPT-6 Luna 每任务 0.22 美元,而 Claude 系列要 18-22 美元;前沿上的模型还包括 GPT-6.1 Sol (max)、Muse Spark 1.3 (max) 等。
- Token 量与成绩无关:GPT-6 Astra (max) 每任务约 8.1 万输出 token 拿到 8.6% 得分,不到 Grok 的水平;Claude 三款模型输出约 20 万 token 仍垫底。
为什么重要
- 法律交付物对事实准确性要求极高,幻觉门控把「不出错」提升为核心评测维度,为专业场景的模型选型提供了更贴近实际风险的依据。
- 评测揭示排名对指标定义高度敏感,提醒从业者不能只看单一基准分数,需同时关注幻觉率、成本与输出长度等多维信号。
2026-10-09 ~ 2026-10-09 · 8 条相关
一手来源
- 加幻觉门槛后 Grok 4.7 居首,超六成合格结果含实质幻觉 — ArtificialAnlys ·
- 幻觉门控改写法律基准排名:Meta Muse Spark 从第一跌至 8.9%,Grok 4.7 登顶 — ArtificialAnlys ·
- Artificial Analysis 联手 Harvey 升级法律基准:幻觉门控成核心指标 — ArtificialAnlys ·
- 【源头】加幻觉门槛后 Grok 4.7 居首,超六成合格结果含实质幻觉 — ArtificialAnlys · 2026-10-09
- 【源头】Artificial Analysis 联手 Harvey 升级法律基准:幻觉门控成核心指标 — ArtificialAnlys · 2026-10-09
- 六款模型当幻觉检查员横评:GPT-6 Sol 查出 470 项,远超 Grok 的 219 项 — ArtificialAnlys · 2026-10-09
- 【源头】幻觉门控改写法律基准排名:Meta Muse Spark 从第一跌至 8.9%,Grok 4.7 登顶 — ArtificialAnlys · 2026-10-09
- 完成标准和不出幻觉是两种能力:Kimi K3 通过率 93% 但每任务 2.09 次幻觉 — ArtificialAnlys · 2026-10-09
- 模型性价比帕累托前沿:GPT-6 Luna 每任务 0.22 美元,Claude 要 18-22 美元 — ArtificialAnlys · 2026-10-09
- Artificial Analysis:输出 token 越多分越高?Claude 三款模型 20 万 token 仍垫底 — ArtificialAnlys · 2026-10-09
- Harvey 法律评测:GPT-6 Astra 得分最高,但输出 token 量与成绩无关 — ArtificialAnlys · 2026-10-09