Grok 4.7 发布:Terminal-Bench 从 20.3% 跃升至 38%
thesaraharminta · x · 2026-09-22
据转发消息,Grok 4.7 已发布,最显著的提升在 Terminal-Bench:从上一代的 20.3% 涨到 38%。
在 CursorBench 上它以 46.3% vs 41.7% 超过 GPT-5.6 Sol,token 定价与 Grok 4.6 持平。不过在两项基准上仍落后于 Fable 5.1,总体算是一次扎实但不登顶的迭代。
所属事件:xAI 发布 Grok 4.7 主打编码与长任务(26 条相关)→
「模型」频道最新
- Grok 4.7 又翻车:花 $1.59 输出惨不忍睹,遭全网围观 — teortaxesTex · 2026-09-22
- 实测打脸:1000 条诈骗广告分类,拟合 TF-IDF 基线完胜 LLM — justinbiebar · 2026-09-22
- Evo 2 模型内部竟编码「生命之树」:激活流形对应物种演化关系 — burny_tech · 2026-09-22
- 内部实测:Grok 4.7 在 22 项知识工作中排第 3,成本低于 5 美元 — realsohamparekh · 2026-09-22
- Codex 代码泄露 GPT-6 Luna:已内置定价,疑似与 Sol 同期发布 — haider1 · 2026-09-22
- Alex Atallah:专用小模型涌现,Jev 时刻或重塑 AI 生态 — multiply_matrix · 2026-09-22