研究:不足 1% 定向扰动即可篡改 LMArena 榜首排名
lintool · x · 2026-09-26
NeurIPS 新论文提出统一扰动框架,分析 Bradley-Terry 类榜单(LMArena 等)的稳定性与可操纵性。要点:
- 方法:基于影响函数近似,研究三种对局级扰动(Drop、Add、Flip)及选手删除对排名的影响
- 发现:在 Chatbot Arena 与另外 6 个成对比较数据集上,现代榜单在三个目标上都不稳健——不足 1% 的定向扰动即可改变榜首模型、降低 Kendall's tau 一致性、改变置信区间
- 攻击面:同一套影响分数可用于高效定向操纵,以比既往操纵与主动采样基线更少的动作提升或压低特定模型
- 价值:提供数据集级稳健性评分,可用于审计榜单稳定性、推动更稳健的评测协议
「研究」频道最新
- 康奈尔学者:扩散语言模型距实用还缺关键要素 — CatAstro_Piyush · 2026-09-26
- Opus 5.5 一小时生成 3Blue1Brown 风格论文动画,全程零人工干预 — hsu_byron · 2026-09-26
- 训练 600M 小模型引入滑动注意力窗口与记忆机制的一手实验 — KlausCodes · 2026-09-26
- Cadence 架构:面向持续高效智能流的新型设计 — rvp · 2026-09-26
- 550 条样本训练 15 分钟,小模型本地推理 0.06 秒替代 Gemini — newz2000 · 2026-09-26
- WetLabs 基准发布:9 项湿实验任务实测机器人能否加速科研 — ericjang11 · 2026-09-26