别把评测分数差一两分看太重

xeophon · x · 2026-07-19

作者强调,**ECI 结果本身并不是问题**,关键在于要理解这是 **IRT**(项目反应理论)框架下的测量结果,不能把分数差异直接当成绝对优劣。 他提醒:**所有模型的误差条都很大**,因此“某个模型只是多了 1–2 分就严格更强”的说法并不可靠。解读这类榜单时,应把不确定性和统计误差一起看。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →