Artificial Analysis 联手 Harvey 升级法律基准:幻觉门控成核心指标
ArtificialAnlys · x · 2026-10-09
Artificial Analysis 与法律 AI 公司 Harvey 合作发布 LAB-AA v1.1,更新法律 Agent 基准(LAB)评分方法,新增幻觉检查——只有当交付物满足全部评分标准且不含实质性错误陈述时才计分,新核心指标为 Hallucination-Gated All-Pass Rate。
- 依据 Harvey 的人类偏好研究,专家把幻觉视为在两个同等全面的回答中做选择的首要决定因素
- 新流水线聚焦可能实质影响真实法律工作的错误,并采取保守标记策略
- 区分「无来源支持的任务特定断言」与一般法律知识,后者不计入,模型不会因引用源文件之外的判例或法条被扣分
- 检查分两阶段,均使用 GPT-6 Sol (high),将交付物与任务源文件逐一比对;无可提交成果的任务计零分且不纳入幻觉统计
所属事件:幻觉门控改写法律基准排名,Grok 4.7 登顶(8 条相关)→
「模型」频道最新
- Mistral 高管澄清:FrontierCode 由 Cognition 私有评测,样本不外泄 — b_roziere · 2026-10-09
- Google 把决策模型塞进 Chrome,实测与 Gemini Nano、Decisions API 对比 — gaganghotra_ · 2026-10-09
- 用户随手录 60 秒屏幕,Grok Bot 竟自动剪出像样的教程视频 — elonmusk · 2026-10-09
- Anthropic 使用条款被批「空泛到没有意义」:随时可封禁用户 — ivan_bezdomny · 2026-10-09
- 用户吐槽 codex 表现“如 GPT-3.5”:知识库更新后不重审结论 — Yamapama · 2026-10-09
- 置信度校准胜过准确率:Nimble 9B 自动化路由量达基座 2.7 倍 — AgitatedUsual8995 · 2026-10-09