Grok 4.6 跑分追平 GPT-5.6,智能体性能居前沿且成本极低
ArtificialAnlys · x · 2026-08-12
Artificial Analysis 发布了 Grok 4.6 的详细评测。该模型在智能指数中得分 61,成功跻身前沿阵营,与 GPT-5.6 Sol 持平,仅次于 Anthropic 的 Claude Opus 5 和 Claude Fable 5。
智能体性能强劲
- 在 GDPval-AA v2 评测中表现优异,仅次于 Claude Opus 5。
- 在 𝜏³-Banking 和 Terminal-Bench v2.1 测试中均位居前列。
- 在长周期知识工作任务私有评测 AA-Briefcase 中,展现出极高的轮次效率,完成任务平均只需约 53 轮,远低于 Claude Opus 5 的 103 轮。
极具性价比
- 定价与 Grok 4.5 持平,为每百万 token 输入 $2 / 输出 $6。
- 比 Claude Opus 5 和 GPT-5.6 Sol 便宜 60% 以上,稳居“智能与成本”帕累托前沿。
所属事件:Grok 4.6 发布,登顶多项基准且定价不变(11 条相关)→
「模型」频道最新
- DeepSeek V4 Pro 0813 流传测试成绩截图曝光 — op7418 · 2026-08-13
- DeepSeek V4 Pro 正式版发布,传闻测试成绩惊人 — op7418 · 2026-08-13
- 简单任务也该用强模型?实测称 Fable 写邮件远超 Opus — mattbeane · 2026-08-13
- DeepSeek V4 Pro 0813正式发布:Agent能力大幅提升,OpenRouter上线 — scaling01 · 2026-08-13
- 网友求推荐:Qwen 3.6 27B 之后的最佳本地模型有哪些? — ludwigABAP · 2026-08-13
- 阿里发布Qwen3.8 Max:2.4T参数MoE,1M上下文,开源可商用 — AdinaYakup · 2026-08-13