Seedream 团队发布 VoT:像素渲染前先进行视觉思考

JingxiangSun42 · x · 2026-09-13

字节 Seedream 团队发布新研究 VoT: Vision-of-Thought,用于统一多模态表征对齐。核心设计是在 VLM 与 DiT(扩散主干)之间加入一个 VoT 分支,让模型在真正渲染像素之前先完成"视觉思考",将推理式的思维链范式引入图像生成过程。

所属事件:字节 Seedream 团队发布 VoT:让模型先思考再作画(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →