研究指出:0.003% 票数变动即可改写 LMArena 榜首
rishabh16_ · x · 2026-09-14
MIT 研究者 Shuvom Sadhuka 发表博文《Who are we aligning to?》,审视标注数据集与对齐的代表性问题。
- 对齐 = 能力 + 价值观;即便模型能力越来越少依赖人类,价值观仍锚定在人类偏好上,关键问题是"对齐到谁的价值"
- 引用历史案例(如 Kipling 的《白人的负担》)说明作恶者往往自认行善,价值 elicitation 是对齐问题的第一半,而多数讨论只聚焦第二半
- 关键数据:研究发现去掉仅 0.003% 的投票就足以改变 LMArena 榜首模型;投票分布高度不均,少数"重度用户"贡献了大部分票数
- 这意味着众包偏好数据的微小扰动和不均衡结构可能对模型排行与下游对齐产生不成比例的影响
文章主张对齐讨论应更关注"我们在复制谁的价值"这一被忽视的半边问题。
「安全」频道最新
- e/acc 阵营开炮:头部 AI 公司图谋监管俘获,别被「节奏论」迷惑 — whurley · 2026-09-14
- 微软单月修复 974 个安全漏洞创纪录,归功 AI 与效率提升 — jonerp · 2026-09-14
- 安全圈内讧:Heidy Khlaaf 炮轰 METR,Joshua Saxe 力挺 — Turn_Trout · 2026-09-14
- Dario 称政府与公众应持有 AI 股份、支持监管,遭 e/acc 嘲讽 — whurley · 2026-09-14
- METR、Transluce、RAND 等 8 机构成立独立 AI 评估者论坛,发布 AEF-1 标准 — kevin_klyman · 2026-09-14
- METR、Transluce、RAND 等组建独立 AI 评估者论坛,发布评估标准 — kevin_klyman · 2026-09-14