数据稀缺下个性化对齐:APO 方法仅需 20 条用户样本

Liyan Yang · hf · 2026-10-07

针对真实用户在多目标上偏好高度异质、但个人反馈数据稀缺导致个性化对齐困难的问题,作者提出近似帕累托最优(APO)方法:先将更新方向兼容的用户分组以减少干扰,再在组内结合梯度下降与受控上升协调竞争目标,逼近组内用户的帕累托前沿,得到支持少样本适配的初始化,并用少量本地更新迭代精化。理论上给出单步本地协作更新的条件次优界,刻画初始化误差对后续随机适配的影响。在 Fed-ChatbotPA 和 UltraFeedback 上,仅用 20 条本地样本即取得一致优于现有方法的效果。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →