KAIST 提出 SQAM:流策略强化学习微调提速,OGBench 难题成功率最高提升 35 个百分点

kaist-ai · hf · 2026-10-08

KAIST AI 团队发布新方法 Q-learning with Scalar Adjoint Matching(SQAM),用于对流策略(flow policy)进行离线强化学习微调。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →