Artificial Analysis 实测 Grok 4.7:仅次于 Anthropic,成本约 Opus 5 一半
ArtificialAnlys · x · 2026-09-22
Artificial Analysis 发布 Grok 4.7 在其 AA-Briefcase 基准(尽调场景:构建市场模型与标的评估 deck)上的实测结果:
- Grok 4.7 仅次于 Anthropic 系模型,排名紧随 Opus 5 之后,而单任务成本约为其 50%
- 相比 Grok 4.6,分析质量 Elo 从 1698 升至 1994,但演示表达 Elo 从 1531 微降至 1499
- 复刻示例 deck 的 API 成本:Grok 4.7(xhigh)约 $8,Grok 4.6(xhigh)约 $4.40,质量提升伴随约一倍成本上涨
所属事件:Grok 4.7 评测:智能指数 46 进前四,token 消耗翻倍引争议(12 条相关)→
「模型」频道最新
- Azure "小失误"疑泄露 GPT-6-Luna/Sol 模型名称 — scaling01 · 2026-09-22
- 爆料称 OpenAI 新模型或名 GPT-6-Luna 与 GPT-6-Sol,即将发布 — scaling01 · 2026-09-22
- Qwen 3.8 27b 微调版输出冗长减 40%,质量基本无损 — julianharris · 2026-09-22
- METR 发布 OpenAI/Hugging Face 黑客事件独立调查:智能体协作内幕 — JeffLadish · 2026-09-22
- JevBench v1.3.0 发布:原版 Jev 以 74.4 分仍居首,47 个竞品逼近 — airesearch12 · 2026-09-22
- DeepSeek 对阵 Jev:无文本「系统一」模型基准的新对照 — frappuccinoCoin · 2026-09-22