Arena 分析 3 万组对比:不同 LLM 仅共享 43% 思路
arena · x · 2026-09-12
LMArena 发布基于 Battle Mode 的模型相似度分析,覆盖 5 月 1 日至 9 月 2 日的 30,086 对真实 Text Arena 提示词的回答对,衡量模型间「概念重合度」:
- 不同 LLM 平均仅共享 43.1% 的思路,各家模型覆盖的概念面差异明显
- 同代际相邻版本高度相似:Grok 4.5 与 4.6 重合 59.7%,GPT 5.5 与 5.6 重合 59.2%
- 中美模型思路趋同:Fable 5 与 GLM 5.3 重合 55.9%;GLM、Kimi、Opus、Sonnet 形成一个高重合邻居圈
团队以此回答「哪个模型与 Fable 最像」——答案既不是 Opus 也不是 Sonnet。
「模型」频道最新
- 初创公司用 GPT-6 Astra 打造无人机,一张照片即可锁定追踪特定人 — Polymarket · 2026-09-12
- 397B 多模态新模型 Nex-N2.5 Pro 上架 OpenRouter,主打 Computer Use — nikola_mr64990 · 2026-09-12
- Gary Marcus 阵营:分子性质预测都做不好,GPT-6 谈何 AGI — GaryMarcus · 2026-09-12
- 用户吐槽 Grok Bot 越用越笨:AI 产品为何总这样? — billyjhowell · 2026-09-12
- Every 弃纯榜单:用真实工作自建个人基准评新模型 — danshipper · 2026-09-12
- 用户抱怨 Gemini 实时搜索频繁失效,连购物查询也被拒 — Dimensional-Misfit · 2026-09-12