Grok 4.6 登顶 AutomationBench-AA 第二,超越多款旗舰模型

XFreeze · x · 2026-09-08

X 用户 XFreeze 发帖称,Grok 4.6 在更新后的 AutomationBench-AA 基准中排名第二,超过 Claude Fable 5.1、GPT-5.6、Kimi K3 等模型。该基准测试的是跨 SaaS 工具的真实 agentic 工作流,而非静态问答,显示 Grok 在实际执行任务方面能力显著增强。注意:消息来自第三方转发,具体成绩未附原始来源,真实性待确认。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →