别把评测分数差一两分看太重
xeophon · x · 2026-07-19
作者强调,**ECI 结果本身并不是问题**,关键在于要理解这是 **IRT**(项目反应理论)框架下的测量结果,不能把分数差异直接当成绝对优劣。 他提醒:**所有模型的误差条都很大**,因此“某个模型只是多了 1–2 分就严格更强”的说法并不可靠。解读这类榜单时,应把不确定性和统计误差一起看。
「模型」频道最新
- 前沿模型已超越人类数学能力 — littmath · 2026-07-20
- 中国模型在 OpenRouter 上领先 — JOBhakdi · 2026-07-20
- AI解RH会被区别对待的段子 — tak3sh8 · 2026-07-20
- 泄露称 GLM-5.5 可能8月发布 — teortaxesTex · 2026-07-20
- Gemini 出现奇怪崩坏 — windowssandbox · 2026-07-20
- Hermes 发布桌面与路由大更新 — Teknium · 2026-07-20