FailBank 把运行时安全反馈变成长期监督,VLA 成功率最多提 25.4 点

notredame · hf · 2026-10-05

针对 VLA(视觉-语言-动作)机器人在复杂环境中任务成功与意外接触难以兼顾的问题,notredame 团队提出四阶段自进化框架 FailBank。

思路:运行时 safety shield 只能纠正单个动作、不改策略,反复干预会造成持续的「策略-护盾」错配。FailBank 把运行时反馈转化为持久策略改进:

结果:在 VLA-Arena 基准、两个 VLA 骨干上,较基础策略任务成功率提升 8.5 和 6.9 个百分点,策略导致的累计代价分别降低 35.6% 和 23.8%;较运行时 shielding 成功率提升 25.4 和 9.5 个百分点,累计代价相当。结论:运行时反馈可以成为持久的策略监督信号,而非临时动作约束。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →