Grok 4.6 智能体评测追平 GPT-5.6,编程能力实现大幅跨越

kimmonismus · x · 2026-08-12

xAI 最新发布的 Grok 4.6 在多项基准测试中展现出惊人实力。根据 xAI 官方公布的数据,该模型在 AA Intelligence Index 中以 61 分追平 GPT-5.6 Sol,并在 CursorBench、FrontierCode 和 AA-Briefcase 测试中取得领先。

不过在 DeepSWE 和 Terminal-Bench 等更底层的测试中,Grok 4.6 仍落后于 GPT-5.6 Sol。官方透露,该模型经历了更长的补充训练周期,重新生成了 SFT 轨迹并加强了智能体强化学习。

所属事件:xAI 正式发布 Grok 4.6 模型并开放 API(9 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →