Self-OPD:无教师流的流匹配模型策略蒸馏

Shiyi Zhang · hf · 2026-08-28

Self-OPD (On-Policy Distillation) 是一种用于流匹配模型的新方法,旨在消除任务特定的教师模型。它通过利用自我探索的随机分支和标准化优势来优化速度场,从而实现多目标对齐。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →