数据稀缺下个性化对齐:APO 方法仅需 20 条用户样本
Liyan Yang · hf · 2026-10-07
针对真实用户在多目标上偏好高度异质、但个人反馈数据稀缺导致个性化对齐困难的问题,作者提出近似帕累托最优(APO)方法:先将更新方向兼容的用户分组以减少干扰,再在组内结合梯度下降与受控上升协调竞争目标,逼近组内用户的帕累托前沿,得到支持少样本适配的初始化,并用少量本地更新迭代精化。理论上给出单步本地协作更新的条件次优界,刻画初始化误差对后续随机适配的影响。在 Fed-ChatbotPA 和 UltraFeedback 上,仅用 20 条本地样本即取得一致优于现有方法的效果。
「研究」频道最新
- COLM 论文:潜空间推理模型的潜 token 多数可解码,可解释性即正确性信号 — sarahwiegreffe · 2026-10-07
- Apple ML 招聘研究实习生:让基础模型「知道自己知道什么」 — sineadwilliamso · 2026-10-07
- CAVEAT 测试台登场:商店促销能否带偏你的 AI 购物 Agent — ZacharyHuang12 · 2026-10-07
- GEA:以群体为进化单元的 Agent 自我改进范式,SWE-bench 71% — xwang_lk · 2026-10-07
- 9B 模型花 25 美元算力微调,达 Jev 决策指数 79% 分数 — sophiamyang · 2026-10-07
- 机器人学会「恢复技能」,真机任务成功率从 77.5% 升至 87.5% — qinzytech · 2026-10-07