业内激辩 VLM 与 MLLM 术语定义

Jitendra Malik、TimDarcet 等人在 X 上围绕 VLM(Vision-Language Model)的定义展开争论,焦点是 CLIP 这类图像/文本表示编码模型是否应算作 VLM。与此同时,有帖子针对学术界与工业界混用 VLM、MLLM 术语的现象进行澄清:CLIP 类模型通常被称为 VLM,而像 LLaVA 这样基于 LLM 接受图像输入的模型应称为 MLLM。

2026-08-25 ~ 2026-08-26 · 2 条相关