Agent Arena 帕累托前沿:DeepSeek V4.1 单任务6美分,国产模型霸占低价区间
arena · x · 2026-09-26
Agent Arena 公布成本-性能帕累托前沿,对比各模型净改进与单任务中位成本:
帕累托最优梯队:Claude Fable 5.1 (Max) +13.80%/$4.11、GPT 6 Astra (Max) +10.85%/$2.82、Claude Opus 5 (High) +9.80%/$2.15、Claude Fable 5 (High) +8.28%/$1.71、GPT 6 Sol (Max) +7.68%/$0.74、Claude Sonnet 5 (High) +4.79%/$0.70。
低价区间被中国模型占主导:Kimi K3 (Max) +4.55%/$0.67、腾讯 Hy4 preview +4.37%/$0.17、DeepSeek V4.1 Flash (Max) +4.10%/$0.06、腾讯 Hy3 -5.63%/$0.04、小米 Mimo V2.5 Pro -6.45%/$0.04。整体排名前15还包括 Gemini 3.8 Flash、GLM 5.2 等。
所属事件:Agent Arena 榜单发布:Claude Fable 5.1 居首(4 条相关)→
「编程与Agent」频道最新
- 两个 AI agent 同处 Slack:一个修 issue,一个审代码 — Al_Grigor · 2026-09-26
- 学术 agent Memex 升级 Opus 5.5:写作质量修复,体验大好 — arjunrajlab · 2026-09-26
- 开发者用开源多模态模型让 AI 重新设计折叠 iPhone,一个 HTML 文件跑出完整产品概念 — alifcoder · 2026-09-26
- Anthropic 上线 Claude 插件目录提交门户,MCP 使用量年内涨 110 倍 — ClaudeDevs · 2026-09-26
- 开源项目 Jev 实时通关《宝可梦红》,决策速度快到能玩复杂游戏 — supportingthedogs · 2026-09-26
- Anthropic 深度实测 Claude Code effort 机制:高强度适合安全与代码审查 — trq212 · 2026-09-26