Grok 4.6 登顶多项知识与法律生产力评测
elonmusk · x · 2026-08-13
马斯克转发了关于 Grok 4.6 最新评测成绩的推文。据称,该模型在两个最强知识工作与实际生产力基准(GDPVal-AA 和 AA-Briefcase)以及法律基准测试中均取得领先地位。同时,在编码智能体和通用智能指标方面也保持了高度的竞争力。
「模型」频道最新
- 资深开发者反思AI编程:模型推理常犯低级错误,不如手写代码 — jsuarez · 2026-08-13
- Databricks 评测称 Grok 在 OfficeQA Pro V2 达 SOTA — GavinSBaker · 2026-08-13
- Vercel AI Gateway 上线 Grok 4.6,支持 50 万 tokens 上下文 — soleio · 2026-08-13
- xAI 为 SuperGrok 用户发放每周额度免费重置券 — XFreeze · 2026-08-13
- Krea、FLUX 与 MiniMax 集中开源,但“开放权重”名不副实 — felixsanz · 2026-08-13
- Anthropic 因 Claude Code 额外收取加速费遭用户痛批 — Neel_MynO · 2026-08-13