专题 · FULL STORY

Grok 4.7:从泄露到正式发布

9 月 21 日,grok-4.7 短暂现身 OpenCode Zen 模型目录,引发发布倒计时猜测;次xAI 正式发布 Grok 4.7,定位最强编码与知识工作模型,同价提速、长程任务大幅增强,多项基准成绩显著跃升,社区实测陆续跟进。

2026-09-21 ~ 2026-09-22 · 3 集 · 36 条

第 1 集 · Grok 4.7 短暂现身 OpenCode Zen,疑似今日发布(2026-09-21,5 条)

9 月 21 日,xAI 下一代模型 Grok 4.7 疑似进入发布倒计时:多位 X 用户发现 grok-4.7 短暂出现在 OpenCode Zen 的模型目录中,随后被删除,被广泛解读为发布临近的信号。同日另有用户爆料称 Grok 4.7 将于当天下午发布,并给出具体规格与定价信息。目前 xAI 官方未作任何确认。

已确认

  • grok-4.7 确实出现在 OpenCode Zen 的模型目录中,随后被删除。@kimmonismus、@CurieuxExplorer、@socialwithaayan 均报告了这一发现,@CurieuxExplorer 调侃称能出现在菜单里,说明它已经在厨房里了。
  • xAI 官方截至目前未就 Grok 4.7 的发布作出确认。

尚未确认

  • @ns123abc 发帖称 Grok 4.7 将于今日下午早些时候发布,并附截图为据,但无官方依据。
  • @realsohamparekh 爆料称 Grok 4.7 今日发布,规格为 500K tokens 上下文窗口、支持多模态、定价与 Grok 4.6 相近。该消息来自个人账号,未经 xAI 证实。
  • @kimmonismus 与 @socialwithaayan 均预测本周是「大模型发布周」:xAI 之后 OpenAI(Dev Day)与 Anthropic 可能接连有动作,此为个人推测。

为什么重要

  • OpenCode Zen 目录中短暂出现的模型名通常被视为供应商正式上线前的先兆,因此该事件被社区视为 xAI 新模型即将发布的强信号。
  • 若 500K 上下文与多模态、定价持平 Grok 4.6 的传闻属实,Grok 4.7 将在长上下文与性价比上对同期竞品形成直接竞争,但一切以 xAI 官方公告为准。

第 2 集 · Grok 4.7 上线:同价提速,长程任务大幅增强(2026-09-21,5 条)

xAI 发布 Grok 4.7,多名社区用户跟进确认新模型已上线,并疑似出现在 xAI API 中,与发布消息相互印证。综合爆料,新版本在定价不变的情况下带来显著的基准与能力提升,是本轮发布最值得关注的事件。

已确认

  • Grok 4.7 已发布并可用:@DanielLockyer 等用户确认新版本上线,@iamfakhrealam 称据 LuminaBench 爆料,Grok 4.7 已出现在 xAI API 中。
  • 定价与 4.6 持平:$2/M 输入、$6/M 输出,另有双倍价格的双速版(@markk 转述)。
  • 升级方向:更大的底座模型、更长的 RL 训练;官方称新模型能在困难的多小时级长任务上坚持更久,并更仔细地自我检查结果(@nimaowji、@markk 转述)。
  • 基准表现:Terminal-Bench 从 20.3% 提升至 38.0%(@markk 转述,帖中标注未证实)。

尚未确认

  • 各帖多为第三方账号爆料,早期帖(@markk、@koltregaskes)明确标注未经 xAI 官方渠道证实;后续社区确认与 API 现身增强了可信度,但 xAI 官方渠道的完整说明与详细基准数据仍待发布。

为什么重要

  • 同价提速叠加 Terminal-Bench 近翻倍的成绩,直接提升 Grok 在 agent 与终端任务场景的性价比竞争力。
  • 强调数小时级长程任务与自我检查能力,表明 xAI 正把 agent 场景作为主要竞争方向。

第 3 集 · xAI 发布 Grok 4.7 主打编码与长任务(2026-09-22,26 条)

9 月 22 日,xAI 正式发布 Grok 4.7,定位为最强编码与知识工作模型,官方宣称速度为同类模型的两倍、价格仅为一半;标准版定价与 Grok 4.6 持平(输入 $2/百万 token、输出 $6/百万 token),另提供输出速度翻倍、价格也翻倍的快速版。基准成绩明显提升是本次发布最受关注的亮点,直接冲击编程与知识工作模型的性价比格局。

已确认

  • Grok 4.7 采用全新的更大基础模型,针对耗时数小时的多步任务做了更长的强化学习训练,更擅长自我验证与长上下文管理,并原生理解 Grok Bot 系统;官方还强调其搭载迄今最强的安全护栏
  • 基准提升显著:CursorBench 4.0 从 40.4% 升至 46.3%,超过 GPT-5.6 Sol 的 41.7%;Terminal-Bench 从上一代的 20.3% 跃升至 38%;Harvey 法律基准也大幅上涨
  • 模型已在 API、Cursor 与 Grok Build 上线,支持 Low/Medium/High/Extra High 四档推理强度,可按任务选择;用户可在终端运行 grok update 将 Grok Build 升级到最新版本
  • 官方发布对比演示视频:让 Grok 4.7 与 4.6 完成同一任务——搭建一个开放世界城市游戏,直观展示新模型在长时间任务上的能力
  • NVIDIA 官方转发祝贺并表示为 xAI 提供加速算力支持,马斯克高调转发官宣
  • 团队成员 aksheyd 表示团队花了大量时间打磨 harness,模型在 Grok Build 和 Cursor 中实际表现出色;转发者 mattyp 补充其在软件工程、长时程知识工作、电气工程与法律任务场景尤强;核心成员 haozhuwang 介绍 4.7 专门在更长时序的问题上训练,上下文保持更好

尚未确认

  • 博主 XFreeze 的第三方点评称 Grok 4.7 在多小时办公任务(AA Briefcase)上出现巨大跃升,超越 GPT-6 Astra 并接近 Fable 5.1,此为个人解读,具体分数以官方基准表为准

为什么重要

  • 同价同速下大幅提升基准表现,且价格仅为同类竞品的几分之一,Grok 4.7 直接冲击编程与知识工作模型市场的性价比格局
  • 长时间多步任务与自我验证能力的强化,配合四档推理强度选择,瞄准了 Agent 式办公与开发场景的实际需求;已有开发者(minchoi)表示将更新工作流适配新模型

还有 6 条相关讨论 →