字节 Seed 提出 RWTD:一步生成模型后训练,GenEval 0.73→0.80
ByteDance-Seed · hf · 2026-10-02
字节跳动 Seed 团队提出 Reward-Weighted Transport Distillation (RWTD),一种只需生成样本和标量奖励评估的一步生成模型后训练方法:
- 难点背景:一步生成器既无可解 likelihood 也无去噪轨迹,且很多奖励不可微,常规后训练难以进行
- RWTD 不只对齐传统的 reward-tilted 参考分布,而是构造混合「当前分布」与「参考分布」的自适应目标——当前分量纳入训练中发现的新改进,参考分量锚定预训练生成器以防遗忘
- 通过特征空间最优传输与不动点回归实现该目标;理论分析表明其不动点分布在 off-policy 与 on-policy 奖励倾斜之间插值
- 实验上将一步 SANA Sprint 1.6B 的 GenEval 从 0.73 提升到 0.80,偏好对齐实验显示跨奖励泛化,组合能力得以保留
「多模态」频道最新
- 山岳级风暴龙视频 prompt 全文:四镜头电影级生成拆解 — ArjanDoge · 2026-10-02
- BFL 开放 FLUX Tools 免费试用,商用模型权重可联系获取 — bfl_ai · 2026-10-02
- FLUX 3 Image 发布:黑森林工作室推新一代文生图模型 — chrisfirst · 2026-10-02
- MiniMax H3 复刻 1991 年动画《Doug》,效果出乎意料 — Certain_Potato_4509 · 2026-10-02
- ChatGPT 上线虚拟试衣:上传自拍即可试穿衣服与配饰 — TechCrunch AI · 2026-10-02
- Tacit-TTS:免转写零样本声音克隆,比 IndexTTS2 快 10 倍 — Jian Chen · 2026-10-02