研究揭示 LLM 排行榜稳定性差:成对投票微小扰动即可颠覆排名

beirmug · x · 2026-09-25

一篇研究 LLM 排行榜稳定性的论文获 ICML CTB workshop oral,并已被 NeurIPS 2026 接收。作者构建了统一框架,审计成对投票的微小变动如何波及排行榜排名,结论是 LLM 排行榜的稳定性远低于人们预期。论文与项目页均已公开。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →