马斯克称 Grok 4.5 登顶长程终端任务基准

elonmusk · x · 2026-07-21

埃隆·马斯克转发 Grok Build,并引用称 **Grok 4.5** 在 **Long-Horizon Terminal-Bench** 的二元通过率排名里拿到第一。 - 引用内容称,Grok 4.5 在最严格的评分标准下,击败了 **Claude Fable 5、Claude Opus 4.8 和 GPT-5.6-sol**。 - 这个基准强调长链路终端任务:不仅要做出部分进展,还要能在数百步流程里持续保持上下文、修正错误并完成全流程。 - 结论是:Grok 4.5 在复杂的 agentic 编码和自动化任务上表现出明显优势。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →