马斯克称 Grok 4.5 登顶长程终端任务基准
elonmusk · x · 2026-07-21
埃隆·马斯克转发 Grok Build,并引用称 **Grok 4.5** 在 **Long-Horizon Terminal-Bench** 的二元通过率排名里拿到第一。 - 引用内容称,Grok 4.5 在最严格的评分标准下,击败了 **Claude Fable 5、Claude Opus 4.8 和 GPT-5.6-sol**。 - 这个基准强调长链路终端任务:不仅要做出部分进展,还要能在数百步流程里持续保持上下文、修正错误并完成全流程。 - 结论是:Grok 4.5 在复杂的 agentic 编码和自动化任务上表现出明显优势。
「编程与Agent」频道最新
- 用代码自动计时计费,识别卡死的编程代理 — VCBU · 2026-07-21
- 一次编程会话里,Claude Opus 4.8 Fast 被吐槽太贵 — immersive-matthew · 2026-07-21
- WAIC 青年论文奖聚焦端侧多模态与 ChatDev 框架 — 面壁智能 · 2026-07-21
- 有人在给 ComfyUI 补一个后置字幕编辑流程 — Strong-Loan8299 · 2026-07-21
- 为什么持续写入会让向量数据库拖慢 AI agent — PrajwalTomar_ · 2026-07-21
- 一段 13 分钟视频讲透 GitHub Copilot 的 prompt caching — lee_stott · 2026-07-21