因果分析揭示单层设计,VLA 跨注意力参数可删 97%

mathildepapillo · x · 2026-08-05

Goodfire 的 Silico 平台发布研究报告,通过因果分析优化视觉语言动作模型(VLA)效率。研究发现,动作专家通常只读取 VLM 中较窄的中后部层带。

以 MolmoBot 为例,通过激活修补测试发现仅第 24 层对指令行为影响最大。基于此“单层设计”进行剪枝,移除了 97% 的跨注意力参数,动作专家 FLOPs 降低 93.5%,整体 FLOPs 降低 40.2%。在千次模拟测试中,简化后的模型成功率与原版几乎持平。

所属事件:因果分析优化机器人模型,大幅削减算力与冗余参数(2 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →