APA 提出动态对齐流水线,避免 AI 价值锁定
sebkrier · x · 2026-07-26
- 这篇工作提出 Adaptive Pluralistic Alignment(APA),目标是在社会价值观变化时,持续更新 AI 对齐,而不是把模型锁死在一套固定偏好上。
- APA 分三步:先学习紧凑的个性化奖励模型;再用一个“陪审团”通过类似社会选择的投票机制从候选输出中挑选;最后随着标注者偏好变化,持续调整陪审团权重。
- 作者强调,这种做法可以缓解 value lock-in(价值锁定),避免每次价值变化都重新大规模采集偏好数据、从头训练。
- 他们用 PRISM 多用户对齐数据集做了概念验证,发现陪审团构成和投票规则会显著影响结果,尤其在偏好差异较大时。
- 论文还公开了代码和偏好数据集。
「研究」频道最新
- PFN 走原生数值架构,后训练 LLM 在大表格上掉队 — GaelVaroquaux · 2026-07-26
- 仿象鼻机械臂用内置摄像头实现触觉感知 — rvp · 2026-07-26
- 逆向 SolidWorks 文件发现操作历史,可训练 CAD 模型 — yacineMTB · 2026-07-26
- Epoch AI 发现,风格化 AI 文本更容易绕过检测器 — dl_weekly · 2026-07-26
- 开源 4B 模型在瑞典医学考试上逼近 o3 水平 — AccomplishedCat4770 · 2026-07-26
- Graph Engineering 主张用显式图结构而不是只靠循环 — Aiden_Tech_Ai · 2026-07-26