Grok 4.7 登顶 Harvey LAB-AA 排行榜,力压 Claude 与 GPT 旗舰

XFreeze · x · 2026-10-09

据 X 用户 XFreeze 称,Grok 4.7 在 Harvey LAB-AA v1.1 排行榜上排名第一,超过 Claude Opus 5.5、GPT-6 Astra、Muse Spark 1.3 等模型。

该基准的特点是极其严苛:只要出现一次实质性的事实幻觉(material hallucination),整个任务就会被判零分。也就是说,它衡量的不是「答案对不对」,而是「能否在不产生实质幻觉的前提下完整跑对整个任务」。作者认为这显示 Grok 4.7 在高风险推理场景上正变得非常强。

所属事件:LAB-AA v1.1 加幻觉门控,Grok 4.7 登顶法律 Agent 榜(9 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →