曝 Grok 4.7 发布:同价提速,Terminal-Bench 20.3%→38.0%(未证实)
mark_k · x · 2026-09-22
网传 xAI 即将发布 Grok 4.7(消息未获官方证实):更大底座模型、更长 RL 训练,支持可运行数小时的长程 agent 任务,价格与速度与 4.6 持平($2/M 输入、$6/M 输出,另有双倍价格的双速版)。基准提升明显:CursorBench 4.0 从 40.4%→46.3%,Terminal-Bench 4.0 从 20.3%→38.0%,EEBench 53.0%→64.0%,Harvey 法律基准 15.8%→19.6%,GDPval 1605→1695 Elo。对比竞品,声称在 CursorBench 和 Terminal-Bench 上击败 GPT-5.6 Sol,在 EEBench 和 Harvey 上领先 Sol 与 Fable 5.1;Fable 仍在 CursorBench、Terminal-Bench 和 GDPval 领先。还重建了安全护栏,更强的越狱抵抗同时减少对合法网络安全工作的误拒。将在 Cursor、Grok Build 和 API 上线。注意:@SpaceXAI 的提法与官方账号不符,发布细节与竞品名需待证实。
所属事件:Grok 4.7 上线:同价提速,长程任务大幅增强(5 条相关)→
「模型」频道最新
- 实测打脸:1000 条诈骗广告分类,拟合 TF-IDF 基线完胜 LLM — justinbiebar · 2026-09-22
- Evo 2 模型内部竟编码「生命之树」:激活流形对应物种演化关系 — burny_tech · 2026-09-22
- 内部实测:Grok 4.7 在 22 项知识工作中排第 3,成本低于 5 美元 — realsohamparekh · 2026-09-22
- Codex 代码泄露 GPT-6 Luna:已内置定价,疑似与 Sol 同期发布 — haider1 · 2026-09-22
- Alex Atallah:专用小模型涌现,Jev 时刻或重塑 AI 生态 — multiply_matrix · 2026-09-22
- 用 GPT Vision + Jev 搭颜值打分器:三步流程实测与踩坑 — huangyun_122 · 2026-09-22