Gemini 4 Argon 登 Agent Arena 第 8,每任务仅 $0.62
arena · x · 2026-10-01
LMArena 旗下 Agent Arena 排行榜更新:Google DeepMind 的 Gemini 4 Argon (High) 以 +7.92% 净提升分位列总榜第 8,并以每任务 $0.62 的成本改写了 Pareto 前沿(性价比边界)。
要点:
- 比上代 Gemini 3.8 Flash (High)(第 19 名,+2.96%)高出 4.96 个百分点
- 在工具可靠性等关键信号上表现突出
- 当前 Pareto 前沿模型还包括 Claude Fable 5.1 (Max, +14.55%, $4.15/task)、Claude Opus 5.5 (High, +13.78%, $1.56/task)、GPT 6 Sol (Max, +10.65%, $0.92/task);开源侧 DeepSeek V4.1 Flash 以 $0.09/task 达 +4.01%
- 榜单基于约 200 万次真实 agent 任务会话,评测工具编排、任务完成率与可控性
所属事件:Gemini 4 Argon 登 Agent Arena 第八(2 条相关)→
「模型」频道最新
- Brundage 称 Codex ultrafast 模式多数任务过于奢侈,不如多开并行 — Miles_Brundage · 2026-10-01
- 传 Gemini 4 argon 分钟内超量子算法优化基线 40%,业界惊叹 — DynamicWebPaige · 2026-10-01
- Codex Ultra Fast 模式烧钱如流水,圈内外热议算力鸿沟 — herbiebradley · 2026-10-01
- Reddit 讨论:本地模型做 Blender 建模仍然力不从心 — Any-Lingonberry7411 · 2026-10-01
- Rox 实测:Jev 重排检索比 GPT-5 Mini 快 20 倍、便宜 10 倍 — hardimanjames · 2026-10-01
- Nat Lambert 谈 Gemini 4:更多前沿实验室竞争是好事 — natolambert · 2026-10-01