幻觉门控改写法律基准排名:Meta Muse Spark 从第一跌至 8.9%,Grok 4.7 登顶
ArtificialAnlys · x · 2026-10-09
Artificial Analysis 在法律 Agent 基准中加入幻觉门控后,多数模型排名大洗牌:
- Meta 的 Muse Spark 1.3 (max) 门控前 26.7% 排第一,门控后跌至 8.9%
- Grok 4.7 (xhigh) 以 9.4% 登顶核心指标
- GLM-5.3 (max) 13.9% 的任务通过全部标准,但无实质幻觉仅 0.3%
- Kimi K3 (max) 从 16.7% 跌至 5.3%;Claude Sonnet 5.5 从 11.7% 跌至 2.8%
- GPT-6.1 Sol (max) 最抗跌,从 7.5% 到 6.9%
所属事件:幻觉门控改写法律基准排名,Grok 4.7 登顶(8 条相关)→
「模型」频道最新
- Mistral 高管澄清:FrontierCode 由 Cognition 私有评测,样本不外泄 — b_roziere · 2026-10-09
- Google 把决策模型塞进 Chrome,实测与 Gemini Nano、Decisions API 对比 — gaganghotra_ · 2026-10-09
- 用户随手录 60 秒屏幕,Grok Bot 竟自动剪出像样的教程视频 — elonmusk · 2026-10-09
- Anthropic 使用条款被批「空泛到没有意义」:随时可封禁用户 — ivan_bezdomny · 2026-10-09
- 用户吐槽 codex 表现“如 GPT-3.5”:知识库更新后不重审结论 — Yamapama · 2026-10-09
- 置信度校准胜过准确率:Nimble 9B 自动化路由量达基座 2.7 倍 — AgitatedUsual8995 · 2026-10-09