开发者分享 OPSD 复现实操:用 judge 定位违规再训练提醒
多位开发者讨论 on-policy steering distillation(OPSD)类方法的最佳实践。作者给出的 steelman 用法是:先用 judge 模型识别 rollout 中明确违反已有约束的片段,定位失败发生前的位置,在该处插入提醒后仅对提醒之后的 token 进行训练。这一建议源于关于“专用化是否是 bitter lesson 方向”的讨论,为希望复现 OPSD 的研究者提供了可操作的路线。
2026-09-26 ~ 2026-09-26 · 2 条相关
- 开发者拆解 OPSD 复现:建议用 judge 定位违规,仅训提醒后 token — willcb · 2026-09-26
- OPSD 实操建议:用 judge 定位违规,在失败前插入提醒再训练 — maouirr · 2026-09-26