WebDev 竞技场 83 万票榜单:Claude Opus 5.5 Max 居首
arena · x · 2026-10-03
LMArena 旗下 Code Arena 发布 WebDev 前端开发模型总榜(截至 2026-10-01,累计 838,388 票、覆盖 138 个模型),考察前端任务与多步推理、工具调用的 agentic coding 工作流。
Top 10:
- claude-opus-5.5-max(Anthropic,1815 分,$4/$20 每百万 token)
- gpt-6-astra-max(OpenAI,1788 分)
- claude-sonnet-5.5-xhigh(1786 分)
- gpt-6.1-sol-max(1758 分)
- claude-fable-5.1-max(1749 分)
- claude-sonnet-5.5-high(1715 分)
- claude-opus-5-max(1695 分)
- gpt-6-sol-max(1689 分)
- gemini-4-argon-high(1680 分,初步)
- qwen3.8-max(Alibaba,1671 分,初步)
榜单前八几乎被 Anthropic 与 OpenAI 包揽;Google Gemini 4、阿里 Qwen3.8、Kimi K3、Meta muse-spark、Grok 4.7 等紧随其后。开源侧腾讯 hy4-preview(Apache 2.0)与 qwen3.8-flash-next 排名 16-17。
「模型」频道最新
- VSA 方案号称可注入 DeepSeek 系模型,10 万 token 推理提升 9.5 分 — teortaxesTex · 2026-10-03
- 批评者指 OpenAI 低调推出 Dot,工具化叙事与「协作实体」定位自相矛盾 — RileyRalmuto · 2026-10-03
- 500 美元 Pro 档 Sol 6.1 用量近乎无限,用户称体验「不真实」 — soumitrashukla9 · 2026-10-03
- Claude Opus 5.5 写出中文书法:「直而温」背后的五轮代码迭代 — dotey · 2026-10-03
- 用户实测:GPT-6.1 Sol 同样工作量额度消耗大幅降低 — soumitrashukla9 · 2026-10-03
- Cohere Embed 5 首次采用新检索评测法 RCP-nDCG@10 — cohere · 2026-10-03