Seedream 团队提出 VoT:让模型在渲染像素前先做视觉思考
JingxiangSun42 · x · 2026-09-13
字节 Seedream 团队发布新工作 VoT: Vision-of-Thought for Unified Multimodal Representation Alignment,将 MoT 扩展为文本、VoT、Diffusion 三个分支,所有分支的 key-value 对拼接后做统一注意力。
在文生图和图生图任务中,VLM 与 DiT 之间插入 VoT 分支:先用离散视觉 token 预测语义规划(即"先视觉思考"),扩散分支再联合关注文本与 VoT 的 KV 表示,合成最终图像。
所属事件:字节 Seedream 团队发布 VoT:让模型先思考再作画(3 条相关)→
「多模态」频道最新
- 教程:在 ComfyUI 里为 MiniMax H3 创建 RefMod — Citadel_Employee · 2026-09-13
- 不会建模的美术总监用 GPT + Blender MCP,45 分钟从零建出医院走廊 — Time-Ad-7720 · 2026-09-13
- Narrative 发布:用提示词驱动 Agent 的平民化 AI 视频编辑器 — Scobleizer · 2026-09-13
- 一张图两种画风:旅行明信片级写实+水彩双风格提示词模板 — nikola_mr64990 · 2026-09-13
- 胡渊鸣发布 Mora 1:代码+3D 生成+实时视频打造 AI 原生游戏 — fredodurand · 2026-09-13
- 设计师求荐:logo 头脑风暴用哪些生成式工具 — RileyRalmuto · 2026-09-13