WTF 框架微调流模型,奖励对齐训练算力最高省 280 倍

yeewhye · x · 2026-09-27

Yee Whye Teh 等人发布论文《WTF?! Simulation-Free Reinforcement Learning with Wasserstein-Tilted Flow Maps》,提出对预训练流生成模型做奖励微调的新范式。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →