15 步手算 RLHF:一条人类偏好如何泛化到未见过的场景
ProfTomYeh · x · 2026-08-28
Prof. Tom Yeh 延续其「by hand」系列,用 15 步手工计算完整走通 RLHF 流程,全程只需填矩阵和向量,不依赖代码。
- 设定:一个奖励模型、一个 LLM,以及两对 (prompt, next) 样本。人类标注偏好:"doc is them" 胜过 "doc is him"——信号不是语法,而是性别偏见。
- 奖励模型训练:对两对样本分别做词嵌入 → 线性层 → 平均池化 → 输出层得到标量奖励(败者 3、胜者 5);把奖励差 2 过 sigmoid 得 σ≈0.9,与目标 1 的差产生梯度 -0.1 回传,奖励模型就此更新。
- 泛化验证:用从未见过的 prompt "CEO is" 推 LLM,模型采样出 "him"(继承偏见);再让奖励模型打分,得 3——与它给 "doc is him" 的分数完全一致。没有人教过它 CEO,但价值观迁移了过去。
- LLM 更新:损失取奖励的负数,梯度 -1 回传更新 LLM 权重。
核心洞察:RLHF 的希望不在单条纠正,而在模型学会人类偏好背后的价值(如性别中立),并主动应用到从未提及的职业上。
「研究」频道最新
- SSMB:直接在运动模糊图像上做自监督关键点检测 — zhenjun_zhao · 2026-08-28
- 自变量机器人发布 WALL-SS:长时程机器人仿真,成功率相关系数 0.93 — chris_j_paxton · 2026-08-28
- 阿里 Accio 发布 CommerceAgentBench:107 个真实电商任务验证智能体执行 — future_coded · 2026-08-28
- 新论文批判性评估VASCO研究:卫星前地球轨道物体说法存疑 — DanielWhiteson · 2026-08-28
- 艾伦研究所视频展示神经元连接并非随机,揭示连接组学奥秘 — CatAstro_Piyush · 2026-08-28
- Cloudflare 优化 1.1.1.1 DNS 缓存:5 处改动省下 100TB 内存 — ritakozlov · 2026-08-28