研究揭示 LLM 排行榜稳定性差:成对投票微小扰动即可颠覆排名
beirmug · x · 2026-09-25
一篇研究 LLM 排行榜稳定性的论文获 ICML CTB workshop oral,并已被 NeurIPS 2026 接收。作者构建了统一框架,审计成对投票的微小变动如何波及排行榜排名,结论是 LLM 排行榜的稳定性远低于人们预期。论文与项目页均已公开。
「模型」频道最新
- Claude 设计可真实拼搭的乐高鸭子:1113 颗零件零碰撞 — fofrAI · 2026-09-25
- Opus 5.5 解 AGI 论文初始火花,更高算力档测试预告中 — iruletheworldmo · 2026-09-25
- 隐身模型 Space Bunny Alpha 现身 LMArena,tokenizer 疑似 MiniMax — Beastly4k · 2026-09-25
- Opus 5.5 发布后抨击 Anthropic 的大 V Tibo 悄然噤声 — rexplosive · 2026-09-25
- 用户称 Meta Muse 好用到「退役」自建 OpenClaw 方案 — analisereal · 2026-09-25
- Gated DeltaNet-2 中稿 NeurIPS,混合线性注意力模型新 SOTA — AccBalanced · 2026-09-25