OPSD 实操建议:用 judge 定位违规,在失败前插入提醒再训练
maouirr · x · 2026-09-26
作者被问“专用化为何是 bitter lesson 方向”,转而给出 OPSD(on-policy steer/distill 类方法)的 steelman 实操建议:
- 用 judge 在 rollout 中识别明确违反「已在上下文中」指导的行为(如 system prompt 规则、工具 schema)。
- 在失败发生前,逐字插入该指导的提醒。
- 只对提醒之后的 token 做训练。
这样做可避免 hint leakage(提示泄漏),是具体可复现的训练流程设计。
所属事件:开发者分享 OPSD 复现实操:用 judge 定位违规再训练提醒(2 条相关)→
「编程与Agent」频道最新
- 团队早就在用 AI 干活了,问题是不知情:AI 运维的关键在「共享」 — beglen · 2026-09-26
- Muse 连接器设计获赞:Steam、B站、DeepSeek 一键接入上下文 — op7418 · 2026-09-26
- 用 Opus 5.5 从仓库代码生成 RSS 插件宣传视频 — vista8 · 2026-09-26
- 用户抱怨 Codex 缺 Ask-Mode:只想提问却总被直接改代码 — dkracket · 2026-09-26
- ChatGPT5.5 加工具链玩推箱子:3 分钟 68 次工具调用 — tak3sh8 · 2026-09-26
- 开源 APK 逆向 Skill 获 1.4k 星,让 Claude Code 像老手分析安卓应用 — lxfater · 2026-09-26