Grok 4.5 真实任务榜登顶
XFreeze · x · 2026-07-11
Grok 4.5 在 AutomationBench-AA 上拿到 #1,用于衡量真实世界 AI 自动化任务能力。
- 得分 51%,高于 Claude Fable 5(49%)和 Claude Opus 4.8(48%)
- 号称每个任务成本约为对手的 1/4
- 每任务仅用约 8K 输出 token,作者称其在前沿模型里 token 效率很高
这条帖子的核心是在强调:Grok 4.5 不只是分数领先,也在真实任务的成本与 token 效率上表现突出。
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11