Grok 4.7 登顶 Harvey LAB-AA 排行榜,力压 Claude 与 GPT 旗舰
XFreeze · x · 2026-10-09
据 X 用户 XFreeze 称,Grok 4.7 在 Harvey LAB-AA v1.1 排行榜上排名第一,超过 Claude Opus 5.5、GPT-6 Astra、Muse Spark 1.3 等模型。
该基准的特点是极其严苛:只要出现一次实质性的事实幻觉(material hallucination),整个任务就会被判零分。也就是说,它衡量的不是「答案对不对」,而是「能否在不产生实质幻觉的前提下完整跑对整个任务」。作者认为这显示 Grok 4.7 在高风险推理场景上正变得非常强。
所属事件:LAB-AA v1.1 加幻觉门控,Grok 4.7 登顶法律 Agent 榜(9 条相关)→
「模型」频道最新
- 纽约 AI 晚宴纪要:推理优化靠 agent 找、代码审查已不划算 — paulnovosad · 2026-10-10
- 中国免费开源模型会否催生 ChatGPT 的平价替代 Agent? — jade_jade_jade_jade · 2026-10-10
- PostTrain Agent 全自动后训练拿 PostTrainBench 榜首,距人类专家仅差 4.5 分 — jiqizhixin · 2026-10-10
- OpenAI 论文众包团队用人类+Agent 协作推进,新前沿模型或即将发布 — RexDouglass · 2026-10-10
- 回顾早期 GPT 评测:GPT-2 学英语时顺带学会了 JavaScript — moyix · 2026-10-10
- 用户与 Claude 争论决策理论:模型默认反叛为理性,被说服后改口 — xuanalogue · 2026-10-10