Grok 4.7 模型卡发布:Terminal-Bench 成绩从 20.3% 跳至 38.0%
ns123abc · x · 2026-09-22
xAI 发布 Grok 4.7 模型卡,编程终端基准 Terminal-Bench 4.0 榜单出现明显变化:
- Claude Fable 5.1 以 57.9% 继续大幅领先所有模型
- Grok 4.7 从 20.3% 跃升至 38.0%,反超 GPT-5.6 Sol
进步幅度显著,但距离榜首 Claude 仍有近 20 个百分点的差距。
「模型」频道最新
- xAI 修复 SDK 丢失推理内容的 bug,Grok 4.7 性能显著提升 — ns123abc · 2026-09-22
- Artificial Analysis 发布 TTS 全榜:xAI 87.6% 发音准确率居首 — ArtificialAnlys · 2026-09-22
- xAI 更新 SDK 后性能大增,冲进 Vals 榜单前十 — teortaxesTex · 2026-09-22
- Grok 4.7 价格不再便宜,第三方评测已贵过 Astra — steipete · 2026-09-22
- 8GB 显存 + 64GB 内存,哪款 LLM 最像「百科全书」? — Mangleus · 2026-09-22
- 私有基准实测:Xiaomi v2.6 Pro 被评两年最差,Grok 仅 Luna 水平 — Afinetheorem · 2026-09-22