斯坦福 CS 329H 开课:91% 学生选生动答案,揭示偏好数据的隐藏偏差
sanmikoyejo · x · 2026-10-08
斯坦福新课 CS 329H《Machine Learning from Human Preferences》 第一讲(讲师 sanmikoyejo)的开场实验:
- 匿名投票:孩子问「天为什么是蓝」,91% 的学生选了生动的答案而非科学答案;问快排时间复杂度,88% 选了带注意事项的严谨答案而非简单答案——「更好的回答」取决于提问者是谁。
- 推论:在合并比较数据上训练的 reward model 必须对这些上下文取平均,而每一个 thumbs-up 和 arena 投票都带着同样的问题。
- 课程把心理学测量、离散选择、机器学习、决策理论、行为经济学、社会选择理论六个鲜少互相引用的领域工具汇在一起,教训练 RLHF 的人理解偏好模型的隐含假设及其失效条件。
「研究」频道最新
- 实验发现:更强模型写出的自动评测确实更靠谱 — danshipper · 2026-10-08
- 腾讯发布 WorkForge:可扩展合成可验证长程工作 Agent 训练环境 — teortaxesTex · 2026-10-08
- 掩码几何编码器 MGE:随机丢帧+自蒸馏提升 3D 基础模型鲁棒性 — zhenjun_zhao · 2026-10-08
- DensiTok:用流匹配补全未见视角的几何 token,即插即用增强 3DGS — zhenjun_zhao · 2026-10-08
- 水下 3D 重建新法:将平端口相机图像扭曲为针孔透视校正折射 — zhenjun_zhao · 2026-10-08
- MoSE3:追踪分支+可微 Horn 拟合,逐像素恢复世界坐标系 SE(3) — zhenjun_zhao · 2026-10-08