Agent Arena 榜单:Grok-4.6 综合第 15,成功确认率升 13%
arena · x · 2026-08-28
在 Agent Arena 的最新评估中,Grok-4.6 排名第 15,整体净提升 6.1%。细分指标显示,其在「确认成功」方面进步显著(+13.2%),在「Bash 恢复」(+8.8%)和「可引导性」(+4.9%)上也有提升,未出现工具幻觉问题。
「模型」频道最新
- MiniMax-H3 跑 8×H200:无损加速 1.95 倍,最高 6.24 倍 — ying11231 · 2026-08-28
- 深度解析 Engram:并非让本地跑 1T 模型,而是解耦记忆与推理 — chocolateUI · 2026-08-28
- Qwen3.8-Flash-Next-GGUF 在 RTX 5090 上跑出 43.4 tok/s — DerTomsn · 2026-08-28
- Domingos:AI 是迄今最「漏」的抽象层,漏出来的是 LLM 的混乱 — pmddomingos · 2026-08-28
- 观点:模型选择应成「无聊的基础设施」,按任务切换而非绑定 — reddebtt · 2026-08-28
- Ling-3.0-flash-Fin 发布:124B 金融增强模型,API 免费且下周开源 — niacolhealth · 2026-08-28