独立开发者自研大模型共识榜,借鉴电竞算法解决评测排名难题

数字生命卡兹克 · wechat · 2026-08-10

作者周末开发了一个大模型聚合排行榜 AIHOT,将多个主流评测榜单的数据汇总并计算出一个综合“共识分”。

开发过程中最大的难点在于如何公平融合不同维度的榜单。简单的平均排名无法解决各榜单模型基数不同、分差不同、数据缺失等客观差异。为此,作者跳出传统思路,借助 AI 在教育评估与电竞匹配机制中找到了灵感。

最终,系统采用了类似电竞 Elo 机制的 Bradley-Terry 成对比较算法。它将各榜单中模型的直接比较转化为胜负关系,并通过共同对手构建全局网络来推算模型的潜在能力值。此外,系统还引入了先验限制和锚点模型来抑制小样本偶然性并统一百分制标尺。作者公开了该算法的所有细节,并坦言这并非绝对标准,而是提供一种更客观的聚合视角。

原文链接 →

「应用」频道最新

更多「应用」频道 AI 资讯 →