字节Seedream团队提出VoT:让扩散模型先「想」再画
JingxiangSun42 · x · 2026-09-13
字节跳动 Seedream 团队发布论文 VoT: Vision-of-Thought for Unified Multimodal Representation Alignment。
- 现有文生图多为「文本编码器 + 扩散解码器」范式,文本语义直接调制连续噪声,缺少可解释的中间表示来衔接高层语义与低层视觉信号。
- VoT 在 VLM 与 DiT 之间插入一个离散的「视觉思考层」:不再把 VLM 仅当文本编码器用,而是当作多模态规划器,在渲染像素前先生成表示物体、布局等高层视觉计划的离散 VoT token。
- 训练了一个专用 VoT tokenizer,采用闭环目标函数(VLM 对齐 + 特征重建 + 向量量化损失),使 token 对 VLM 语义可读,同时保留生成所需的视觉信息。
- 实验表明 VoT 提升语义对齐,并为可解释、可控生成提供结构化接口。
所属事件:字节 Seedream 团队发布 VoT:让模型先思考再作画(3 条相关)→
「多模态」频道最新
- 不会建模的美术总监用 GPT + Blender MCP,45 分钟从零建出医院走廊 — Time-Ad-7720 · 2026-09-13
- Narrative 发布:用提示词驱动 Agent 的平民化 AI 视频编辑器 — Scobleizer · 2026-09-13
- 一张图两种画风:旅行明信片级写实+水彩双风格提示词模板 — nikola_mr64990 · 2026-09-13
- 胡渊鸣发布 Mora 1:代码+3D 生成+实时视频打造 AI 原生游戏 — fredodurand · 2026-09-13
- 设计师求荐:logo 头脑风暴用哪些生成式工具 — RileyRalmuto · 2026-09-13
- World in World:免训练操控冻结视频世界模型实现重机位与回访 — udmrzn · 2026-09-13