Text Arena 最新榜单:Anthropic 系列霸榜前七
arena · x · 2026-07-31
Text Arena 最新公布的 LLM AutoEval 得分显示,Anthropic 旗下模型包揽了总榜前七名。
榜单亮点:
- 冠军:claude-fable-5 以 1508 分位居榜首。
- 亚军/季军:claude-opus-4-6-thinking(1505分)与 claude-opus-4-7-thinking(1502分)紧随其后。
- 其他厂商:Meta 的 muse-spark-1.1(1491分)位列第八,Google 的 gemini-3.1-pro-preview(1486分)排名第十,而 OpenAI 排名最靠前的 gpt-5.6-sol-xhigh 以 1485 分位列第十三名。
「模型」频道最新
- Grok 2 语音模式疑似延期:X平台上线时间悄然改为“即将推出” — teortaxesTex · 2026-07-31
- Anthropic 发布 Claude Opus 5:编码与知识工作登顶,成本减半 — dl_weekly · 2026-07-31
- Osmosis AI 借 YC 算力与强化学习,挑战闭源大模型 — togethercompute · 2026-07-31
- ChatGPT 限流机制暗坑:无法自查额度且不与 Codex 同步 — Sauers_ · 2026-07-31
- 模型幻觉还是记忆?Opus 5 输出中惊现标注员留言 — aiamblichus · 2026-07-31
- Google 开放 Gemini Robotics ER 2 模型 API — ericjang11 · 2026-07-31