Grok 两个月 Terminal-Bench 从 12.4% 升至 38%,超越 GPT-5.6 Sol
CurieuxExplorer · x · 2026-09-22
推文称 Grok 在 Terminal-Bench 4.0 基准上的成绩两个月内从 12.4% 涨到 38.0%,翻了三倍,并已超过 GPT-5.6 Sol。作者认为这不是渐进式提升而是换挡式跃升。注意这是第三方转述,官方未证实,具体榜单细节待核。
所属事件:Grok 终端编码基准两月翻三倍超越 GPT-5.6 Sol(3 条相关)→
「模型」频道最新
- 云天登吐槽 Codex 频繁误拦:改自家网站也被当网络攻击 — yuntiandeng · 2026-09-22
- 实测 LLM 引用质量问题:八条引用从未全对,多源观点只标一条 — pizzababa21 · 2026-09-22
- 开发者实测 Grok 4.7 失望:3D/2D 建站均失败,不及 Opus 4.6 — prasenx · 2026-09-22
- OpenAI 会吃掉 Jev 的午餐吗?单 token 分类器或是关键 — JnBrymn · 2026-09-22
- 分析:Jev本质是微调LLM分类器,OpenAI恐轻松跟进 — JnBrymn · 2026-09-22
- GGUF 模型可直接在 Hugging Face transformers 中运行,Mac 推理提速 — pcuenq · 2026-09-22