Agent Arena 榜单:Anthropic 三领域居首,Gemini Chat 强 Code 弱
AI_Andrew · x · 2026-10-06
Agent Arena 发布跨领域智能体问题解决能力排行,美国实验室全面领先:
- Anthropic 模型占据 Code、Work、Chat 三个类别的第一名,其中 Claude Fable 5.1 (Max) 领跑 Code 和 Work 并列 Chat 第二,Claude Sonnet 5.5 (Max) 领跑 Chat,Code 第四、Work 第五。
- OpenAI 的 GPT 6 Astra (Max) 在三个类别均进前四:Code 第二,Work 和 Chat 第四。
- 一个值得注意的现象:Code 和 Work 的排名高度联动,而 Chat 明显独立——例如 Gemini 4 Argon (High) 在 Code 仅排第 14、Work 第 12,但 Chat 高居第 5,显示出对话能力的独特优势。
「模型」频道最新
- GPT-6.1 Sol 登 PostTrainBench 仅列第 5,不及 GPT-6 Astra 与 Opus 5.5 — maksym_andr · 2026-10-06
- ChatGPT 给会话起标题时不知道该用哪种语言 — cool101wool · 2026-10-06
- 网友用双 V100 玩起 93GB 的 GLM 5.3 Flash,解码约 20 t/s — lxfater · 2026-10-06
- 3090+16GB 内存跑 Qwen3-Next-80B,MoE 专家替换实现约 3 倍解码提速 — Zestyclose_Reality15 · 2026-10-06
- Anthropic 调查 Claude Opus 5.5 请求错误率升高事故 — ClaudeAI-mod-bot · 2026-10-06
- 1.7B 决策模型 ARC-1 在 4060 Ti 上 20ms 出答案,本地免费替代 API — KMatysek · 2026-10-06