PARED 用人类可读特征奖励替代偏好对来对齐模型

nagpalchirag · x · 2026-07-29

所属事件:新研究提出 PARED 从示范中提取可审计对齐奖励(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →