Grok 4.7 评测:智能指数 46 分进前四,token 消耗翻倍
ArtificialAnlys · x · 2026-09-22
Artificial Analysis 发布 Grok 4.7 评测,xAI 首次跻身智能指数前四实验室:
- 智能指数:46 分,比 Grok 4.6 高 2 分(xhigh 推理档)
- Agent 知识工作:AA-Briefcase 上 1657 Elo,较 Grok 4.6 (high) +111,与 Claude Opus 5、Claude Fable 5.1 同处前沿;GDPval-AA 达 1695 Elo
- 编程 Agent:Grok 4.7 + Grok Build 得分 56(+9),原生 harness 中排第 4,超越 GPT-5.6 Sol,仅次于 Claude Fable 5.1、GPT-6 Astra、Claude Opus 5
- 代价是 token:每任务约消耗 81k 输出 token,比 Grok 4.6 (36k) 多 125%,比 GPT-6 Astra (27k) 多 196%
- 其他小幅变化:Terminal-Bench 4.0 +4.5pp,AA-LCR -3.7pp;幻觉率 34%→29%
- 配置:500k 上下文不变,定价 $2/$6 每百万 token(缓存命中 $0.50),推理力度 low 至 xhigh 可调,输出速度约 188 tokens/秒
所属事件:Grok 4.7 评测:智能指数46分进前四,token消耗翻倍(7 条相关)→
「模型」频道最新
- 曝 Grok 4.7 同价发布:CursorBench 46.3%,双用途风险提示拦截率 96.7% — petrusenko_max · 2026-09-22
- Reliquary-4B 发布:全网矿工贡献 rollout 的去中心化 RL 训练数学代码模型 — const_reborn · 2026-09-22
- 开发者打造 open-jev:浏览器端本地运行的 System One 判别式 AI — HowDevelop · 2026-09-22
- 用户尝试诱导 Jev 幻觉,宣称「骗不动」 — BLUECOW009 · 2026-09-22
- REAP 剪枝 Qwen3.8-Flash-Next MLX 版实测:三个档位怎么选 — MensaProdigy · 2026-09-22
- 开发者自述:DeepSeek V4 NVFP4 优化后 192GB 只剩 2GB 余量 — HankYeomans · 2026-09-22