Grok 4.5 真实任务榜登顶

XFreeze · x · 2026-07-11

Grok 4.5 在 AutomationBench-AA 上拿到 #1,用于衡量真实世界 AI 自动化任务能力。

这条帖子的核心是在强调:Grok 4.5 不只是分数领先,也在真实任务的成本与 token 效率上表现突出。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →