Seedream 团队提出 VoT:让模型在渲染像素前先做视觉思考

JingxiangSun42 · x · 2026-09-13

字节 Seedream 团队发布新工作 VoT: Vision-of-Thought for Unified Multimodal Representation Alignment,将 MoT 扩展为文本、VoT、Diffusion 三个分支,所有分支的 key-value 对拼接后做统一注意力。

在文生图和图生图任务中,VLM 与 DiT 之间插入 VoT 分支:先用离散视觉 token 预测语义规划(即"先视觉思考"),扩散分支再联合关注文本与 VoT 的 KV 表示,合成最终图像。

所属事件:字节 Seedream 团队发布 VoT:让模型先思考再作画(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →