研究揭示多模态 LLM 视觉工具使用存在因果有效性缺失

Zhiheng Wang · hf · 2026-08-13

该论文对多模态大语言模型的“视觉工具使用”进行了因果审计。研究发现,视觉工具的使用往往缺乏因果有效性:返回的观察结果常常未能影响最终答案,或者尽管总体准确率有所提高,但这些工具的使用方式实际上是不连贯的。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →