字节 Seedream 团队发布 VoT:让模型先思考再作画
字节跳动 Seedream 团队发布新研究 VoT(Vision-of-Thought),用于统一多模态表征对齐。其核心设计是在 VLM 与 DiT 扩散主干之间加入一个 VoT 层,让模型在渲染像素之前先进行「视觉思考」,即在生成图像前先做视觉层面的推理。该方法旨在打通视觉语言模型与扩散生成模型,提升多模态统一建模能力。
2026-09-13 ~ 2026-09-13 · 3 条相关
- Seedream 团队发布 VoT:像素渲染前先进行视觉思考 — JingxiangSun42 · 2026-09-13
另有 2 条近重复转述:JingxiangSun42 · JingxiangSun42