Grok 4.7 编码实测翻车:Terminal-Bench 4.0 成绩难看

daniel_mac8 · x · 2026-09-22

Grok 4.7 已发布,但其在 Terminal-Bench 4.0 上的编码成绩「相当糟糕」。作者据此判断 OpenAI 和 Anthropic 在编码模型上领先幅度很大。不过他表示仍喜欢在 Grok Bot 里用 Grok,即聊天场景尚可、终端编码任务不行。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →