OPSD 实操建议:用 judge 定位违规,在失败前插入提醒再训练

maouirr · x · 2026-09-26

作者被问“专用化为何是 bitter lesson 方向”,转而给出 OPSD(on-policy steer/distill 类方法)的 steelman 实操建议:

这样做可避免 hint leakage(提示泄漏),是具体可复现的训练流程设计。

所属事件:开发者分享 OPSD 复现实操:用 judge 定位违规再训练提醒(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →