Grok 4.5 在多项编码基准登顶,修复成本也更低
XFreeze · x · 2026-07-26
Grok 4.5 被描述为新的编码与智能体效率标杆,配图展示了它在多个真实任务基准上的领先表现。
- 在 Long-Horizon Terminal-Bench 上,它同时拿到 mean reward 和 binary pass rate 第一。
- 在 $5 workload 分组里也排第一;VulcanBench v3 达到 91.3%,完成 23 个任务中的 21 个。
- 在 SignalDesk V1 上,它以约 $0.074/次修复 的成本修好 70 个任务中的 69 个,得分 99%。
- 原帖还称,Grok 4.5 在 Augment Code 的 Cosmos picker 里出现了最大的一周使用增幅。
整体主张是:Grok 4.5 不只是能力强,而且在成本效率和真实开发场景采用率上都很突出。
「编程与Agent」频道最新
- whatbroke 对比 agent 轨迹,发现 1B 模型会流畅地调错工具 — Impossible-Alarm-738 · 2026-07-26
- MCP 成功不等于正确,谁来验证工具副作用成了问题 — marcin_michalak · 2026-07-26
- CodeInspectus 通过 MCP 给 Codex 加上本地安全扫描 — hibzy7 · 2026-07-26
- Open Minis 开源完整手机端 AI Agent 技术栈 — dotey · 2026-07-26
- Altman 称 Codex 是一场追赶 Claude Code 的“自杀式任务” — soumitrashukla9 · 2026-07-26
- 聊天编排器把 Claude Code、Codex、Cursor 全部拉到一个界面 — kelvinbksoh · 2026-07-26