Grok 4.6 跑分曝光:编码能力领先,但 SWE 仍存短板

kimmonismus · x · 2026-08-12

用户在体验后对 Grok 4.6 给出了高度评价,认为其实现了疯狂的跨越式提升。

根据 xAI 提供的基准测试数据,Grok 4.6 在 AA 智能指数上以 61 分追平了 GPT-5.6 Sol,并在 CursorBench、FrontierCode 和 AA-Briefcase 测试中取得领先。

不过,在 DeepSWE 和 Terminal-Bench 评测中,它依然落后于 GPT-5.6 Sol。xAI 透露,该模型经历了更长的补充训练周期,重新生成了 SFT 轨迹并进行了智能体强化学习。

所属事件:xAI发布Grok 4.6:性能跻身前沿且极具性价比(26 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →