Hugging Face 工程师自建持续学习基准:SFT 已跑通,SDPO 卡住
ben_burtenshaw · x · 2026-09-07
Hugging Face 工程师分享自己搭建「个人持续学习基准」的计划:让 agent 完成可个性化的日常任务(如日程规划),围绕这些任务构建 RL 环境,注入合成偏好(「我喜欢怎样被安排日程」),用 judge 模型按偏好评估 trace,再对基座模型(LiquidAI/LFM2.5-1.2B-Instruct)跑 benchmark。
训练路径:先在 trace 上做 SFT,再用 judge 提示做 SDPO。目前进展:评测通过、SFT 有效,但 SDPO 尚未跑通——作者判断偏好过于随意,计划手动补充更多偏好来改进 few-shot judge。
「编程与Agent」频道最新
- David Khourshid:战术编程已死,战略编程比以往更重要 — DavidKPiano · 2026-09-07
- Cursor 自托管云 Agent 正式可用:企业可在内网运行代码与工具执行 — thione · 2026-09-07
- Anthropic 开源 Claude Commerce Agents,发布多行业购物电商智能体蓝图 — thione · 2026-09-07
- Kent C. Dodds:别再哀悼手写代码,爱上解决问题才是本质 — mattpocockuk · 2026-09-07
- 一条提示词逆向出童年游戏关卡编辑器,作者曾花数周做同样的事 — DnDiene · 2026-09-07
- Karpathy 参与开源项目 AutoResearch:从想法到论文级证据全自动 — JaynitMakwana · 2026-09-07