Grok 4.7 发布:Terminal-Bench 成绩近乎翻倍,主打长时间任务
Scobleizer · x · 2026-09-22
SpaceXAI 发布 Grok 4.7,定位为最强编码与知识工作模型。要点:
- 采用新的更大基础模型,针对耗时数小时的多步任务做了更长的强化学习训练
- 更擅长自我验证与长上下文,原生理解 Grok Bot 系统
- 基准提升明显:CursorBench 4.0 从 40.4% 升至 46.3%,DeepSWE v1.1 从 65.2% 升至 71.0%,Terminal-Bench 4.0 从 20.3% 升至 38.0%
- 在部分基准上超过 GPT-5.6 Sol 与 Fable 5.1
此为第三方账号转述,详情以官方帖为准。
所属事件:xAI 发布 Grok 4.7 主打编码与长任务(26 条相关)→
「模型」频道最新
- Grok 4.7 又翻车:花 $1.59 输出惨不忍睹,遭全网围观 — teortaxesTex · 2026-09-22
- 实测打脸:1000 条诈骗广告分类,拟合 TF-IDF 基线完胜 LLM — justinbiebar · 2026-09-22
- Evo 2 模型内部竟编码「生命之树」:激活流形对应物种演化关系 — burny_tech · 2026-09-22
- 内部实测:Grok 4.7 在 22 项知识工作中排第 3,成本低于 5 美元 — realsohamparekh · 2026-09-22
- Codex 代码泄露 GPT-6 Luna:已内置定价,疑似与 Sol 同期发布 — haider1 · 2026-09-22
- Alex Atallah:专用小模型涌现,Jev 时刻或重塑 AI 生态 — multiply_matrix · 2026-09-22