Agent Arena 榜单更新:GPT-6 Luna 以 $0.05/任务挤进 Pareto 前沿
arena · x · 2026-09-29
Agent Arena 更新了真实 Agent 任务下的性价比 Pareto 前沿(基于 200 万+ 会话、46 个模型):
- OpenAI GPT-6 Luna (Max) 以中位 $0.05/任务进入前沿,净提升 +1.59%,比 DeepSeek-V4.1-Flash 便宜 29%、比腾讯 Hy4 preview 便宜 76%,分数仅落后 2.27/2.51 个百分点
- 性能榜首仍是 Anthropic Claude Fable 5.1 (Max):+14.06%,$3.47/任务;Claude Opus 5.5 (High) 以 +11.84%、$1.35 居次
- 开源阵营里 DeepSeek V4.1 Flash (Max, MIT) +3.86% 仅 $0.07/任务,腾讯 Hy4 preview (Apache 2.0) +4.10% / $0.21
整体呈现:性能端 Anthropic 领跑,低价端中国开源模型与 GPT-6 Luna 贴身肉搏。
所属事件:GPT-6 Luna 登上 Agent Arena 性价比帕累托前沿(2 条相关)→
「编程与Agent」频道最新
- 黑客松项目 Beethoven:扔一幅画上去,AI 乐队现场演奏 — schwentker · 2026-09-29
- OpenAI DevDay 议程泄露:Codex 将内置平台能力,可开发插件与 App — testingcatalog · 2026-09-29
- 纯代码零素材:单 HTML 文件生成整辆概念车,作者用 Claude Sonnet 5.5 — techartist_ · 2026-09-29
- 用 LLM 做销售线索挖掘总卡壳:偷懒输出与编造邮箱的实操困境 — Royal_icey69 · 2026-09-29
- 审计数千条 rollout:80% 编程 agent 在脑补不存在的评分器 — jonas__m · 2026-09-29
- 浏览器里跑出 120 FPS,Yacine 重提「通用反编译器」旧坑 — yacineMTB · 2026-09-29