Gemini 4 Argon 登顶 Text Arena,每任务成本仅 $0.62
arena · x · 2026-10-01
- Agent Arena:Google DeepMind 的 Gemini 4 Argon (High) 以 +7.92% 净提升分排第 8,每任务成本 $0.62,重塑性价比 Pareto 前沿;比 Gemini 3.8 Flash (High)(#19,+2.96%)高 4.96 个百分点。
- Text Arena:被引推文显示其以 1525 分登顶,超第二名 Claude Opus 4.6 (High) 约 20 分;混合价格 $8/MToken,成最高性价比模型;在 Coding、Hard Prompts、指令遵循、长查询、创意写作等全部居首,中/英/俄语等各职业领域也全第一。
- 分项信号:可控性(Steerability)第 1(+15.88%)、确认成功第 2(+14.15%)、褒贬情绪第 4(+27.74%);Chat 类别第 3(+11.58%)。
- 基于 3000 个真实 agent 会话,数据仍在累积中,属初步排名。WebDev 代码 Arena 排第 8(1679 分)。
所属事件:Gemini 4 Argon 登 Agent Arena 第八(2 条相关)→
「模型」频道最新
- 博主一句话评价:GPT-6.1 Sol 被低估了 — mallow610 · 2026-10-01
- 「最便宜的模型其实是Opus 5.5」:省人时才是真成本 — CamBrazy3 · 2026-10-01
- 港中文系统实验揭示循环语言模型何时真正有效 — CUHK-CSE · 2026-10-01
- 27B 本地模型实测:Dirk-Qwen3.8 全面碾压 Swift-1.5 同底模 — norenEnmotalen · 2026-10-01
- KOL 预热 Gemini 4 Argon:要么封神,要么刷榜到没法用 — thatroblennon · 2026-10-01
- Reddit 热议:用户凭什么为 OpenAI 的失败实验产品买单 — dagerika · 2026-10-01