KAIST 提出 SQAM:流策略强化学习微调提速,OGBench 难题成功率最高提升 35 个百分点
kaist-ai · hf · 2026-10-08
KAIST AI 团队发布新方法 Q-learning with Scalar Adjoint Matching(SQAM),用于对流策略(flow policy)进行离线强化学习微调。
- 问题:微调 flow policy 时,adjoint matching 需要在每个 flow step 对策略做 vector-Jacobian 积分,开销随步数与策略规模增长。
- 发现:预训练 flow policy 的批平均速度 Jacobian 集中在对角线上,据此可推出闭式标量 adjoint——按 flow time 缩放最终动作处的价值梯度,免去逐步 VJP。
- 方法:标量 adjoint 加上对策略生成动作处 critic 价值的惩罚项,构成 SQAM。
- 效果:在 OGBench 最难的四个域上,成功率比各域最强基线高 1835 个百分点;还在真实双臂机器人上微调视觉-语言-动作(VLA)策略,三项任务均优于监督微调。
「具身」频道最新
- Tiny Whoop 穿越机实现 ArUco 标记视觉追踪演示 — k7agar · 2026-10-08
- Boston Dynamics 任命 Alexa 前掌门 Rohit Prasad 为新 CEO — lukas_m_ziegler · 2026-10-08
- Tesla 公布 Optimus 触觉皮肤专利:柔性传感器贴合曲面机械手 — CyberRobooo · 2026-10-08
- Paradromics 脑机接口实现超四年稳定神经记录 — KordingLab · 2026-10-08
- Wandercraft calvin-40 载重 40kg,极少机器人够得着重活门槛 — chris_j_paxton · 2026-10-08
- 日本 Eight Knot 在 ROSCon 展示船舶自律航行,GNSS+IMU 融合定位 — 4310sy · 2026-10-08