Direct-OPD:弱模型 RL 经验迁移强模型
tokenbender · x · 2026-08-21
论文提出 Direct On-Policy Distillation (Direct-OPD) 方法,解决在大模型上重复运行昂贵 RL 的问题。通过在弱模型上运行 RL,然后将其诱导的策略变化(而非最终策略)作为隐式奖励信号蒸馏给强模型。实验表明,该方法能有效利用弱模型提升强模型目标的表现,如将 Qwen3-1.7B 准确率从 48.3% 提升至 58.3%。
「模型」频道最新
- Gemini 3.1 Flash Live 登顶语音 Agent 竞技场,人类盲测更爱它 — _philschmid · 2026-08-22
- 神秘模型 Ox Alpha 测评:接近 Fable 水平,视觉逻辑独立 — Afinetheorem · 2026-08-22
- 搞笑案例:让 OpenAI 找酒店却被建议创立 Expedia — dbasch · 2026-08-22
- Ornith 1.5 与 Qwen 3.8 新增 NInfer 与 oQ4e 量化版 — Pyros-SD-Models · 2026-08-22
- DeepSeek 终于睁开眼:V4-Flash-Vision 上线,看图约一分钱九张 — 量子位 · 2026-08-22
- 曝智谱 GLM 5.3 Flash 与 Kimi k3.1 即将上线 — calabi_and_yau · 2026-08-21