WTF 框架微调流模型,奖励对齐训练算力最高省 280 倍
yeewhye · x · 2026-09-27
Yee Whye Teh 等人发布论文《WTF?! Simulation-Free Reinforcement Learning with Wasserstein-Tilted Flow Maps》,提出对预训练流生成模型做奖励微调的新范式。
- 现有方法把奖励微调视为从 reward-tilted 分布采样(基于 KL 正则),只对基础分布重加权
- WTF 引入直接由预训练漂移构建的最优传输正则,把单个样本向高奖励区域输运而非重加权,并证明该问题等价于流上的确定性最优控制问题
- 由此得到首个原生面向 flow map 的端到端免仿真(simulation-free)RL 微调方法,无需事后蒸馏即可在少步推理下保持强奖励对齐
- 在 ImageNet-256 和文生图实验中,比基线获得更高奖励且多样性相当或更高,训练算力最多节省 280 倍
「研究」频道最新
- 未学过自然语言的「新型心智」写 GPU kernel:28% 通过率、提速最高 66 倍 — repligate · 2026-09-27
- ENGRAM 内存架构或重塑数据中心 DRAM/HBM 配比,省下数十亿美元 — AccBalanced · 2026-09-27
- 从像素到视觉 token:一文讲清 LLM 如何「看」图像 — makaros622 · 2026-09-27
- Spatial-Interactor:让 VLM 像婴儿一样通过交互学会空间推理 — arankomatsuzaki · 2026-09-27
- DeepMind 研究员析 AI 未撼动物理学:真突破需人类知识凸包外洞见 — DaniloJRezende · 2026-09-27
- IIT 德里 4 篇 NeurIPS 2026 主会论文:多语言可解释性与蒸馏新方法 — Tanmoy_Chak · 2026-09-27