MODUS 用单个解码器模型统一任意模态互预测
EPFL-VILAB · hf · 2026-07-29
MODUS 提出了一种统一的 decoder-only any-to-any 多模态建模框架:同一个模型可以在任意模态组合之间做预测,把“任意模态作为输入、任意模态作为输出”这件事统一起来。
- 现有不少 any-to-any 方法依赖从头训练的 encoder-decoder 或 diffusion 架构;MODUS 试图直接复用强大的预训练 decoder-only 模型作为先验。
- 它把不同模态放在对称位置,不需要模态专属的 head、loss 或任务管线。
- 作者举了几个用途:例如通过中间模态做链式生成,或者用另一种模态来对生成结果做跨模态自验证。
- 论文称该方法在多个基准上表现出较强的即插即用能力,并且能和专用/多任务基线竞争。
- 项目材料已经开源。
「多模态」频道最新
- 作者称一张专辑从头到尾都由 AI 制作,使用了 Suno — Kyrannio · 2026-07-29
- 一张图讲清图像生成构图规范,专治元素乱摆 — sujingshen · 2026-07-29
- ComfyUI 教程演示 KREA 2 身份编辑低显存工作流 — cgpixel23 · 2026-07-29
- GPT Image 2 九宫格分镜把喝茶到机甲大战压成一张图 — Practical_Low29 · 2026-07-29
- 改一段提示词,图像就变成了更浓的沙特文化风 — aziz4ai · 2026-07-29
- Twelve Labs 发布面向视频检索、记忆和智能体的技术栈 — qdrant_engine · 2026-07-29