Grok 4.6 智能体评测逼近 Claude Fable 5,单次任务成本仅其五分之一
ArtificialAnlys · x · 2026-08-13
在 Artificial Analysis 的 AA-Briefcase 智能体知识工作基准测试中,xAI 的 Grok 4.6 取得了显著进步,得分与 Anthropic 的 Claude Fable 5 不相上下。
该测试主要评估模型在长周期知识工作中的表现。值得注意的是,Grok 4.6 的单次任务成本仅为 4.42 美元,远低于 Claude Fable 5(22.30 美元)和 Claude Opus 5(17.79 美元),展现出极高的性价比。
所属事件:Grok 4.6 智能体评测登顶,性价比与第一梯队表现亮眼(5 条相关)→
「模型」频道最新
- Anthropic 因 Claude Code 额外收取加速费遭用户痛批 — Neel_MynO · 2026-08-13
- 实测 Claude Opus 5:回复变长三倍,爱用破折号但词汇变简单 — arena · 2026-08-13
- 开发者吐槽:在 AI 时代多花冤枉钱纯属“技术不行” — deliprao · 2026-08-13
- 实测对比:Claude 3.5 Sonnet V4 编码能力碾压 Opus 且近乎免费 — EAccelerate_42 · 2026-08-13
- 实测反馈:Grok 4.6 响应快且智能,能顺畅协同多智能体 — doodlestein · 2026-08-13
- xAI 发布 Grok 4.6 模型与 Grok Bot 智能体 — aman_madaan · 2026-08-13