Grok 4.7 编码实测翻车:Terminal-Bench 4.0 成绩难看
daniel_mac8 · x · 2026-09-22
Grok 4.7 已发布,但其在 Terminal-Bench 4.0 上的编码成绩「相当糟糕」。作者据此判断 OpenAI 和 Anthropic 在编码模型上领先幅度很大。不过他表示仍喜欢在 Grok Bot 里用 Grok,即聊天场景尚可、终端编码任务不行。
「模型」频道最新
- 安全护栏毁了叙事:视频模型画面如电影,打斗戏却集体「退缩」 — CurieuxExplorer · 2026-09-22
- 基于 Qwen3.8-27B 的写作微调模型 Hemmingway-1 上架 Hugging Face — CurieuxExplorer · 2026-09-22
- GPT-6 Astra 多次把模拟人物推下悬崖,Grok/Gemini/Claude 都拒绝了 — CurieuxExplorer · 2026-09-22
- 用户抱怨 Codex 额度遭缩水式下调:还能信大厂吗 — StewartalsopIII · 2026-09-22
- 博弈论视角:抢在对手发布日前一天发模型等于自认更弱? — cocktailpeanut · 2026-09-22
- LFM2.5 端侧评测登顶:2.32GB 内存、8 秒延迟,39 款小模型中并列第一 — maximelabonne · 2026-09-22