xAI 发布 Grok 4.6:主打长时 Agent 任务,基准追平 GPT-5.6 Sol
thione · x · 2026-08-18
xAI 官方发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时间运行的 Agent 任务以及交互式与视觉类工作——无论是研究主题、跨代码库操作,还是把想法变成完整应用,都能在多步骤中保持稳定。
成绩:在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol;在 GDPVal-AA、DeepSWE 1.1、CursorBench 3.2、FrontierCode 1.1 等 agentic 编码与知识工作基准上达到前沿水平。
训练细节:进行了比 4.5 更长的补充训练,使用模型生成的推理与高级技术概念数据、高质量工程数据,并改进了优化器与训练配方;随后用 Grok 4.5 重新生成跨推理强度、agent harness 与多领域的 SFT 轨迹,并以模型化检查过滤问题轨迹。
即日起可在 Cursor 和 Grok Build 中使用,首周提供 2 倍额度。
「编程与Agent」频道最新
- Jacobian:面向智能体的纯数学计算框架 — henloitsjoyce · 2026-08-18
- Agent 技能工程:解耦内容、持久化与触发 — omarsar0 · 2026-08-18
- AI 自动化系统赢得内核优化竞赛第三名 — iScienceLuvr · 2026-08-18
- GitHub Copilot 8 月起默认启用新模型 — tristanbob · 2026-08-18
- 观点:Obsidian 意外成为 AI agent 的完美操作系统 — EXM7777 · 2026-08-18
- 新论文重构 Agent 技能协议:解耦内容与触发 — Zachly · 2026-08-18