Agent Arena 最新排行:Claude Opus 5 领跑,Kimi K3 进前五
arena · x · 2026-08-05
Agent Arena 发布最新排行榜,基于 160 万次会话评估 45 个模型在真实 agentic 任务中的表现。Claude Opus 5 (High) 以 12.10% 的净提升率位居榜首,Claude Fable 5 (High) 和 Claude Opus 5 (Max) 分列二三位。Kimi K3 (Max) 以 10.18% 位列第四,GPT-5.6 Sol 以 10.09% 紧随其后。榜单还提供了工具幻觉率、可操控性等细分指标。
「模型」频道最新
- 网友测试 Grok 生成恶搞图片被安全护栏拦截 — arieljalali · 2026-08-05
- DiffusionGemma 技术报告:并行生成 256 tokens 打破自回归瓶颈 — SungjinAhn_ · 2026-08-05
- Gemini Flash 仍遇瓶颈:无法解开 IMO-2025 第 6 题 — teortaxesTex · 2026-08-05
- OpenAI 新模型 SimpleQA 得分 35%,不及 Pro 预览版 57% — teortaxesTex · 2026-08-05
- 近期 AI 智能体指令遵循能力显著下降 — RexDouglass · 2026-08-05
- OpenAI Codex 显现垄断趋势,原生 Agent 框架生存空间受挤压 — vista8 · 2026-08-05