OraRL:高效可扩展的视频 MLLM 强化学习

Yunheng Li · hf · 2026-08-26

OraRL 提出了一种通过集成 Oracle 轨迹来改进视频多模态语言模型后训练强化学习的方法。该技术利用解耦的优势估计和符号平衡剪枝,在不生成思维链的情况下实现了更高的样本效率和可扩展性。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →