Grok 4.6 智能体评测追平 GPT-5.6,编程能力实现大幅跨越
kimmonismus · x · 2026-08-12
xAI 最新发布的 Grok 4.6 在多项基准测试中展现出惊人实力。根据 xAI 官方公布的数据,该模型在 AA Intelligence Index 中以 61 分追平 GPT-5.6 Sol,并在 CursorBench、FrontierCode 和 AA-Briefcase 测试中取得领先。
不过在 DeepSWE 和 Terminal-Bench 等更底层的测试中,Grok 4.6 仍落后于 GPT-5.6 Sol。官方透露,该模型经历了更长的补充训练周期,重新生成了 SFT 轨迹并加强了智能体强化学习。
所属事件:xAI 正式发布 Grok 4.6 模型并开放 API(9 条相关)→
「模型」频道最新
- DeepSeek V4 Pro 0813 流传测试成绩截图曝光 — op7418 · 2026-08-13
- DeepSeek V4 Pro 正式版发布,传闻测试成绩惊人 — op7418 · 2026-08-13
- 简单任务也该用强模型?实测称 Fable 写邮件远超 Opus — mattbeane · 2026-08-13
- DeepSeek V4 Pro 0813正式发布:Agent能力大幅提升,OpenRouter上线 — scaling01 · 2026-08-13
- 网友求推荐:Qwen 3.6 27B 之后的最佳本地模型有哪些? — ludwigABAP · 2026-08-13
- 阿里发布Qwen3.8 Max:2.4T参数MoE,1M上下文,开源可商用 — AdinaYakup · 2026-08-13