业内激辩 VLM 与 MLLM 术语定义
Jitendra Malik、TimDarcet 等人在 X 上围绕 VLM(Vision-Language Model)的定义展开争论,焦点是 CLIP 这类图像/文本表示编码模型是否应算作 VLM。与此同时,有帖子针对学术界与工业界混用 VLM、MLLM 术语的现象进行澄清:CLIP 类模型通常被称为 VLM,而像 LLaVA 这样基于 LLM 接受图像输入的模型应称为 MLLM。
2026-08-25 ~ 2026-08-26 · 2 条相关
- 业内讨论 VLM 与 MLLM 术语定义差异 — TimDarcet · 2026-08-25
- VLM 概念争论:CLIP 编码器算不算 VLM? — giffmana · 2026-08-26