开发者分享 OPSD 复现实操:用 judge 定位违规再训练提醒

多位开发者讨论 on-policy steering distillation(OPSD)类方法的最佳实践。作者给出的 steelman 用法是:先用 judge 模型识别 rollout 中明确违反已有约束的片段,定位失败发生前的位置,在该处插入提醒后仅对提醒之后的 token 进行训练。这一建议源于关于“专用化是否是 bitter lesson 方向”的讨论,为希望复现 OPSD 的研究者提供了可操作的路线。

2026-09-26 ~ 2026-09-26 · 2 条相关