独立开发者自研大模型共识榜,借鉴电竞算法解决评测排名难题
数字生命卡兹克 · wechat · 2026-08-10
作者周末开发了一个大模型聚合排行榜 AIHOT,将多个主流评测榜单的数据汇总并计算出一个综合“共识分”。
开发过程中最大的难点在于如何公平融合不同维度的榜单。简单的平均排名无法解决各榜单模型基数不同、分差不同、数据缺失等客观差异。为此,作者跳出传统思路,借助 AI 在教育评估与电竞匹配机制中找到了灵感。
最终,系统采用了类似电竞 Elo 机制的 Bradley-Terry 成对比较算法。它将各榜单中模型的直接比较转化为胜负关系,并通过共同对手构建全局网络来推算模型的潜在能力值。此外,系统还引入了先验限制和锚点模型来抑制小样本偶然性并统一百分制标尺。作者公开了该算法的所有细节,并坦言这并非绝对标准,而是提供一种更客观的聚合视角。
「应用」频道最新
- SkySend: 端到端加密的开源自托管文件分享工具 — tom_doerr · 2026-08-10
- 独立开发者挑战 100 天赚 1 万刀:AI SEO 工具进展与数据分享 — ayushtweetshere · 2026-08-10
- 新奥尔良市部分 911 报警接线员被 AI 聊天机器人取代 — Polymarket · 2026-08-10
- Decart AI 推出实时试衣 Chrome 插件 Anywear — sophiamyang · 2026-08-10
- 竞品纷纷退场,Browser Company创始人重申押注AI浏览器 — charliedeets · 2026-08-10
- 经济学家用 AI 审阅论文被批得体无完肤,却大呼要续费 — paulnovosad · 2026-08-10