Grok 4.7 专业工作评测反超 GPT-6 Astra,领先超 150 Elo
XFreeze · x · 2026-09-22
在 Artificial Analysis 的同一轮评测中,Grok 4.7 在专业交付物基准 GDPval-AA 上领先 GPT-6 Astra 达 +153 Elo,在多小时办公任务基准 AA-Briefcase 上领先 +88 Elo。
这意味着 Grok 4.7 已在「专业级工作产出」和「长时间办公任务」两类评测上同时占优。发帖人称 SpaceXAI 正在把 Grok 强力推向真实世界的知识工作场景。
所属事件:Grok 4.7 评测:智能指数进前四,成本仅 Opus 一半但 token 翻倍(16 条相关)→
「模型」频道最新
- 曝阿里 Qwen 冲 5-10 万亿参数,Qwen 4 已开训并自研真吾 V900 芯片 — mark_k · 2026-09-22
- EEBench 对比引热议:Grok 4.7 被指产出“无法审查的电路垃圾” — teortaxesTex · 2026-09-22
- 爆料称 OpenAI 新智能体命名为 Aeon,或周四上线对标 Grok Bot — ZeroStateReflex · 2026-09-22
- 实测打脸:Grok 4.7 每任务 token 反而少 46% — ns123abc · 2026-09-22
- 研究者类比:研究 LLM 心理学像 1850 年研究人类心理 — repligate · 2026-09-22
- Meta 发布 SAM 3.1 分割模型,网友演示用它做 GIF — Necessary-Garlic-704 · 2026-09-22