新研究提出 PARED 从示范中提取可审计对齐奖励

一项新研究提出了名为 PARED 的对齐方法,旨在解决现有 SFT 死板模仿以及 RLHF/DPO 依赖昂贵偏好标注的局限。研究指出,示范数据比逐 token 模仿含有更丰富的优化信号。PARED 结合逆强化学习与人类可读的特征投影,从专家示范中提取出可审计的对齐奖励,从而实现更高效且透明的模型对齐。

2026-07-29 ~ 2026-07-29 · 3 条相关