Arena 分差体感与模型对比
TomLucidor · reddit · 2026-07-18
帖子认为,Arena.AI 上不到 30 分的差距通常“体感不明显”。作者举例说,人们往往把“比一半还强”理解成大约 59% 的胜率;如果把这个优势再减半,约等于 54%,对应的 ELO 差大概是 30 分左右。
他用这个标准解释为什么 Kimi-k3 会引发讨论:它与头部模型的差距“足够接近”。另外他还补充说,Mimo-v2.5-pro 在软科学、人文学科以及管理、法律等专家型工作负载上是 SOTA,而 Kimi 更偏向技术任务,但外界讨论往往更集中在 vibe coding。
「模型」频道最新
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- Terminal Bench v4 榜单:GLM-5.3 以 41.9% 一骑绝尘 — Ok_Warning2146 · 2026-09-11