微软 ShieldVLA 用 HJ 可达性做 VLA 安全对齐,安全成本平均降 57%
MicrosoftResearch · hf · 2026-09-22
微软研究院提出 ShieldVLA,一个面向视觉-语言-动作 (VLA) 模型的安全对齐微调框架。
- 问题:现有微调方法多用拉格朗日软惩罚约束预期累计安全成本,常导致残余违规或过度保守;且视觉领域缺乏逐步安全标注,学习安全行为困难。
- 方法:基于 Hamilton-Jacobi (HJ) 可达性,直接从视觉观测学习 model-free 的可达性价值函数近似,估计安全运行区域;学到的安全 critic 对策略优化进行门控,把可行域内的奖励最大化与不安全状态附近的恢复行为分开,避免持续的奖励-成本权衡。
- 可扩展监督:引入基于 rubric 的 VLM 安全评分,把语义安全反馈转化为结构化 critic 目标,无需人工成本标注。
- 效果:在五个导航与操作基准、多个 VLA 主干上,累计安全成本平均降低 57%,任务成功率较 SafeVLA 提升 +0.13。
「具身」频道最新
- 开发者自建仿真器让 Unitree G1 空翻,坦承难辨真实度 — rsasaki0109 · 2026-09-22
- 无摄像头 AI 眼镜 VONDER 发布:骨传导麦克风,299 美元起预订 — alex_verem · 2026-09-22
- 机器人公司破局之道:先部署再用协同感知补能力短板 — broodsugar · 2026-09-22
- 机器人 Astra 自主给自己的身体装上新模块,作者直呼意外 — mhmazur · 2026-09-22
- 「可提示硬件」探索:让 AI agent 住进日常物品的 50 个概念 — genmon · 2026-09-22
- iRobot 破产后,前三星工程师开源扫地机器人 OOMWOO 44 天获千星 — Aiden_Tech_Ai · 2026-09-22