Burkov 统一视角:DPO/IPO/KTO/SimPO/ORPO 是同一框架的三轴选择

burkov · x · 2026-09-15

机器学习研究者 Andriy Burkov 推荐一篇统一偏好学习技术的文章,回应 RLHF 转向更简单直接方法后「该选哪种」的困惑。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →