偏好优化算法 KTO 升级为 TRL 稳定 API

ethayarajh · x · 2026-07-06

HuggingFace 训练库 TRL 将偏好学习方法 KTO(Kahneman-Tversky Optimization)正式提升为稳定 API,KTOTrainer 与 KTOConfig 从实验性接口毕业,便于研究者更稳定地进行偏好优化训练。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →