零额外数据的 DPO 新法:用随机 prompt 造被拒响应

natashajaques · x · 2026-07-07

介绍一种简单方法,可在已微调模型上跨一系列基准带来显著性能提升,且无需额外数据、标签或监督。

做法是构造 DPO 偏好对:偏好响应 yc 用真实 prompt x 生成,被拒响应 yr 用一个随机 prompt x' 生成。作者预告周三公布详情。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →