Anthropic-HH 数据集:6.5% 标注者贡献一半偏好投票
rishabh16_ · x · 2026-09-14
Shuvom Sadhuka 在其关于对齐数据集的博文中给出一个关键观察:少数标注者贡献了常见对齐数据集的大部分投票。
- 在 Anthropic-HH-RLHF 数据集中,仅 21 名(6.5%)标注者提供了 50% 的偏好投票
- 他提出一个检验方法:比较"去掉头部投票者"与"随机去掉同样数量投票"对模型排行的影响,以此衡量"对齐"对少数人的敏感度
- 配有推文线程与完整博文链接
这与另一条推文引用的 LMArena 0.003% 敏感性研究同属一项工作,质疑当前对齐实践的统计基础。
「安全」频道最新
- e/acc 阵营开炮:头部 AI 公司图谋监管俘获,别被「节奏论」迷惑 — whurley · 2026-09-14
- 微软单月修复 974 个安全漏洞创纪录,归功 AI 与效率提升 — jonerp · 2026-09-14
- 安全圈内讧:Heidy Khlaaf 炮轰 METR,Joshua Saxe 力挺 — Turn_Trout · 2026-09-14
- Dario 称政府与公众应持有 AI 股份、支持监管,遭 e/acc 嘲讽 — whurley · 2026-09-14
- METR、Transluce、RAND 等 8 机构成立独立 AI 评估者论坛,发布 AEF-1 标准 — kevin_klyman · 2026-09-14
- METR、Transluce、RAND 等组建独立 AI 评估者论坛,发布评估标准 — kevin_klyman · 2026-09-14