Self-OPD:无教师流的流匹配模型策略蒸馏
Shiyi Zhang · hf · 2026-08-28
Self-OPD (On-Policy Distillation) 是一种用于流匹配模型的新方法,旨在消除任务特定的教师模型。它通过利用自我探索的随机分支和标准化优势来优化速度场,从而实现多目标对齐。
「研究」频道最新
- Amdahl定律盲区:AI影响讨论普遍高估任务加速倍数 — joshua_saxe · 2026-08-28
- LLM 强化学习完全指南:从原理到前沿研究 — jiqizhixin · 2026-08-28
- 登 Science 封面:BeyondMimic 赋能人形机器人空翻 — kevin_zakka · 2026-08-28
- 扩散模型专著 v3 发布,新增离散扩散章节 — mittu1204 · 2026-08-28
- 用不超过 10 个词解释 LLM 内部核心概念 — red-baton-ant · 2026-08-28
- 谷歌推PPE引擎,AI全自动搞定地理空间预测 — aigclink · 2026-08-28