Hugging Face 工程师自建持续学习基准:SFT 已跑通,SDPO 卡住

ben_burtenshaw · x · 2026-09-07

Hugging Face 工程师分享自己搭建「个人持续学习基准」的计划:让 agent 完成可个性化的日常任务(如日程规划),围绕这些任务构建 RL 环境,注入合成偏好(「我喜欢怎样被安排日程」),用 judge 模型按偏好评估 trace,再对基座模型(LiquidAI/LFM2.5-1.2B-Instruct)跑 benchmark。

训练路径:先在 trace 上做 SFT,再用 judge 提示做 SDPO。目前进展:评测通过、SFT 有效,但 SDPO 尚未跑通——作者判断偏好过于随意,计划手动补充更多偏好来改进 few-shot judge。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →