新论文用逆强化学习从示范中提取可审计对齐奖励
nagpalchirag · x · 2026-07-29
- 论文指出,现有对齐方法没有充分利用专家示范:SFT 只是逐 token 模仿,RLHF/DPO 又依赖昂贵的偏好对或验证器。
- 作者提出 PARED(Projected Alignment Reward Estimated from Demonstrations):用一个轻量判别器,在少量响应级特征上,从示范数据里恢复一个显式奖励函数。
- 这个奖励被设计成可审计、可复用、可检查,而且不需要任务特定的偏好标注。
- 论文实验显示,PARED 可用于 推理时重排序 和 对抗式 on-policy RL,并且在标准 SFT 之后继续优化还能带来额外收益。
- 文章还展示了 上下文对齐:同一个策略可以按不同受众的偏好进行定制;可用特征既可以是长度、风格,也可以加入 AI feedback。
所属事件:新研究提出 PARED 从示范中提取可审计对齐奖励(3 条相关)→
「研究」频道最新
- 手推 11 步详解 VAE:打通扩散模型与 RLHF 的核心 — ProfTomYeh · 2026-07-29
- OpenRoboto 在 Bittensor 主网上线机器人模型竞赛 — const_reborn · 2026-07-29
- 微服务目录实测:Markdown、GraphRAG、MCP 图工具各有不同失效模式 — JeremyCMorgan · 2026-07-29
- Google Research 称微小脑样本揭示神经元可连 50 个突触 — GoogleAI · 2026-07-29
- 研究探讨MoE架构安全漏洞:安全层或成AI最大零日威胁 — JimR_Ai_Research · 2026-07-29
- 用 Claude 挑战量子信息难题,AI 推演后称需百万美元算力 — bronzeagepapi · 2026-07-29