加幻觉门槛后 Grok 4.7 居首,超六成合格结果含实质幻觉
ArtificialAnlys · x · 2026-10-09
Artificial Analysis 与 Harvey 联合发布法律 Agent 基准(LAB)方法学更新 v1.1,新增幻觉检查:只有交付物满足全部评分标准且不含「实质性幻觉」才计入头条指标 Hallucination-Gated All-Pass Rate。实质性幻觉指会在实质问题上误导读者(如写错合同要求日期),轻微幻觉单列不计入。
核心发现:
- Grok 4.7 (xhigh) 以 9.4% 居首,其后是 Meta Muse Spark 1.3 (max) 的 8.9% 和 OpenAI GPT-6 Astra (max) 的 8.6%。
- 幻觉改写排行榜:若无幻觉门槛,Muse Spark 1.3 会以 26.7% 的 all-pass 率明显领先,但其 2/3 的合格结果含实质幻觉;GPT-6 Astra 几乎全部保留(8.9%→8.6%),从并列第 10 升至第 3。
- GPT-6 家族最 grounded:Astra 平均每任务 0.03 个实质幻觉(120 个任务共 4 个),在 6 个 checker 模型交叉验证下均为零;对比 Gemini 3.8 Flash 平均每任务 13.96 个。
- 榜首未必最贵:Grok 4.7 每任务约 $9.50,不到最贵的 Claude Fable 5.1(约 $21.70)的一半;Muse Spark 1.3 约 $4.20/任务性价比突出。
所属事件:幻觉门控重塑法律基准:Grok 4.7 登顶,超六成合格结果含幻觉(8 条相关)→
「模型」频道最新
- LightOnOCR-3新增全页grounding:单提示词切换OCR模式 — IgorCarron · 2026-10-09
- TypeSafe 推出决策模型 Jev:分类任务快 200 倍、成本低 400 倍 — LangChain · 2026-10-09
- 开发者反馈 Opus 5.5 上线后「Junior 变聪明了」 — zeeg · 2026-10-09
- Polymarket 开设 GPT-6.1 Astra 发布预测盘,年底前概率 93% — Polymarket · 2026-10-09
- Zeeg 自述几乎弃用 GPT:Opus 5.5 太强,Codex 额度总不够用 — zeeg · 2026-10-09
- 325 个模型限时造怪物:三分之一首次即败,超预算是最大坑 — Binxtv · 2026-10-09