Grok 4.6 跑分曝光:编码能力领先,但 SWE 仍存短板
kimmonismus · x · 2026-08-12
用户在体验后对 Grok 4.6 给出了高度评价,认为其实现了疯狂的跨越式提升。
根据 xAI 提供的基准测试数据,Grok 4.6 在 AA 智能指数上以 61 分追平了 GPT-5.6 Sol,并在 CursorBench、FrontierCode 和 AA-Briefcase 测试中取得领先。
不过,在 DeepSWE 和 Terminal-Bench 评测中,它依然落后于 GPT-5.6 Sol。xAI 透露,该模型经历了更长的补充训练周期,重新生成了 SFT 轨迹并进行了智能体强化学习。
所属事件:xAI发布Grok 4.6:性能跻身前沿且极具性价比(26 条相关)→
「模型」频道最新
- Grok 4.6 智能指数达 61,追平 GPT-5.6 跻身第一梯队 — aman_madaan · 2026-08-13
- OpenAI 实时语音模型轮次检测近乎完美,攻克语音交互顽疾 — pbbakkum · 2026-08-13
- 特斯拉工程师实测:Grok 4.6 成日常主力,图像处理极佳 — aman_madaan · 2026-08-13
- xAI 发布 Grok 4.6,首发登陆 Cursor 与 API — aman_madaan · 2026-08-13
- xAI 高管暗示 Grok 4.5 将至:主打编码智能体 — aman_madaan · 2026-08-13
- 网友猜测:Grok 4.6 是 Kimi K3 的微调版? — robertpro01 · 2026-08-13