Grok 4.6 登顶部分智能体基准,长程任务表现紧追 Claude Opus
ArtificialAnlys · x · 2026-08-12
在 Artificial Analysis 的长程智能体知识工作私有基准(AA-Briefcase)中,xAI 的 Grok 4.6 首次亮相便取得 1577 的 Elo 分数,紧随 Claude Opus 5 之后。
测试结果显示,Grok 4.6 在评分标准、演示文稿和分析质量等多个维度上均表现出强劲且稳定的实力。
「模型」频道最新
- DeepSeek V4 Pro 上线 OpenCode Go,附流传测试成绩 — op7418 · 2026-08-13
- Grok 4.6 智能体榜单登顶,与 Claude Opus 5 Max 并列第一 — XFreeze · 2026-08-13
- DeepSeek 4 Flash 价格战正酣,社区期待 4 Pro 定价 — AccBalanced · 2026-08-13
- Grok Build 面向 SuperGrok Heavy 订阅者开放 4.6 模型 — EricBuess · 2026-08-13
- 简单任务也该用强模型?实测称 Fable 写邮件远超 Opus — mattbeane · 2026-08-13
- 网友求推荐:Qwen 3.6 27B 之后的最佳本地模型有哪些? — ludwigABAP · 2026-08-13