Grok 4.6 登顶 AutomationBench-AA 第二,超越多款旗舰模型
XFreeze · x · 2026-09-08
X 用户 XFreeze 发帖称,Grok 4.6 在更新后的 AutomationBench-AA 基准中排名第二,超过 Claude Fable 5.1、GPT-5.6、Kimi K3 等模型。该基准测试的是跨 SaaS 工具的真实 agentic 工作流,而非静态问答,显示 Grok 在实际执行任务方面能力显著增强。注意:消息来自第三方转发,具体成绩未附原始来源,真实性待确认。
「模型」频道最新
- 有 Cyber 权限仍频遭安全护栏拦截,用户吐槽 Claude 拦截过严 — IgorCarron · 2026-09-08
- astra 与 fable 风格相反:一个爱问为什么,一个埋头就写 — Liu_eroteme · 2026-09-08
- 爆料称 DeepSeek 灰度测试中出现两款 V4-Flash-Vision 模型 — teortaxesTex · 2026-09-08
- 网传 GPT-6 Astra 演示盘点:直播、老游戏、3D 场景与完整网站 — aitrendz_xyz · 2026-09-08
- DeepSeek V4.1Flash 中间版本开启内测:新架构、原生多模态,输出最快 507 tokens/s — 智东西 · 2026-09-08
- 用户称 OpenAI API 全天无响应,请求挂 30 分钟后被丢弃 — msch6873 · 2026-09-08