开发者拆解 OPSD 复现:建议用 judge 定位违规,仅训提醒后 token
willcb · x · 2026-09-26
- 作者给出 OPSD(on-policy steering distillation 类方法)的最佳 steelman 用法:用 judge 识别 rollout 中明确违反已在上下文内规则(如系统提示、工具 schema)的行为,在失败发生前插入逐字提醒,只在提醒后的 token 上训练。
- 优点:避免 hint leakage,缓解长上下文下规则遵循问题;工具 schema 失败是最明确的收益点。
- 质疑:同样的事可用 RL 奖励惩罚实现,看不出 OPSD 为何更优;且训练模型做出与前置推理可能冲突的动作,若关心 CoT 忠实性会有问题。
- 作者转述圈内复现共识:「效果不行,但要是行就很酷」。
所属事件:开发者分享 OPSD 复现实操:用 judge 定位违规再训练提醒(2 条相关)→
「编程与Agent」频道最新
- mnemos.world 将推 agent 自营商店,AI 智能体可卖画自筹经费 — RileyRalmuto · 2026-09-26
- MCP 工具静默返假成功:一个值得命名的 bug 类型与检测法 — Goaimoat · 2026-09-26
- 别让 AI 做 pptx 了:网页版幻灯片动画更好,但给老板汇报还得交 PPT — lxfater · 2026-09-26
- 观点:个人 Agent 会同质化,真正护城河是持续积累的个人上下文 — vaibhavbetter · 2026-09-26
- Matt Pocock:CODING_STANDARDS.md 应在创建 5 分钟后就开始被填满 — mattpocockuk · 2026-09-26
- 自建基准:35B 的 Qwen3.6 得 95%,完胜 120B 的 GPT-OSS 53% — pauliusztin · 2026-09-26