Grok 4.7 登顶 Agent Arena 第16名:提升 +3.96%,单价涨 54%
arena · x · 2026-09-27
Agent Arena 公布 Grok 4.7(xHigh)成绩:以 +3.96% 净提升分位列第 16 名,但单价明显上涨——单任务中位成本 $1.14,对比 Grok 4.6(High)$0.74(净提升 +1.22%)与 Grok 4.5 的 $0.43(+1.50%)。
按信号维度排名:
- Confirmed Success 第 6(+10.41%)
- Bash Recovery 第 12(+5.98%)
- Praise vs Complaint 第 16(+4.93%)
- Steerability 第 28(-1.89%)
- Tool Hallucination 无问题(+0.36%)
官方宣称 Grok 4.7 在同价同速下优于 4.6,但 Arena 数据显示价格与性能同步抬升,性价比角度值得观察。
「模型」频道最新
- Every 实测 Opus 5.5:把 Codex 用户拉回 Claude 怀抱 — every · 2026-09-27
- Allie Miller 批评 Opus 5.5 过度冗长:对比 GPT-6 Sol 等模型移动端输出 — alliekmiller · 2026-09-27
- AI 模型距顶级设计还差 5% 打磨,设计师价值仍难替代 — zielinskiwoj · 2026-09-27
- MLX 社区投票:前三名视觉模型全部由 MLX-VLM 驱动 — andrejusb · 2026-09-27
- Google AI Pro 订阅用户发现 Gemini 中 Pro 模型消失只剩 Flash-Lite — BassNPedal · 2026-09-27
- 「Claude 还有什么干不了?」一句感慨引发能力边界讨论 — prasenx · 2026-09-27