博主观点:文本与视频大模型分工拐点到来,文生视频只是过渡
karminski3 · x · 2026-09-08
博主 karminski3 提出判断:文本大模型与视频大模型的定位拐点已经到来,两者正形成上下游关系——空间理解强的模型(如 GPT-6、Kimi-K3)负责「显式符号/几何模拟」的语义与几何骨架,视频生成模型(如 Seedance)退居下游,做流体、毛发、布料等模拟代价大的细节渲染。
由此推论:1) 纯 Prompt 抽卡式文生视频只是技术过渡,未来专业管线是「意图 → 3D 白模与时空轨迹 → 神经渲染补全」;2) 影视与 3D 制作的 pricey 环节被概率式补全重塑,创作者核心竞争力回归空间因果、视听调度与叙事编排。他还以 AI 剪纸动画(虾仁系列)为例:放弃逼真细节仍能打动人,说明戏剧节奏与骨架比「皮囊」更根本。
「多模态」频道最新
- Midjourney 渲染宏大场景尺度感与细节,作者直呼惊艳 — ciguleva · 2026-09-08
- Pinokio 里串起 Wan2GP 与 MiniMax H3 视频生成工作流 — cocktailpeanut · 2026-09-08
- 16 张图一个主提示词,Basic Slop 生成完整 AI 音乐视频 — bennash · 2026-09-08
- AI 生成幽游白书藏马大战毒藤女,动作场面仍会角色变形 — Ok-Giraffe-8670 · 2026-09-08
- ASTRA 画自由泳教学图给人类安上三条手臂 — kaljakin · 2026-09-08
- 用 Seedance 2.5 一条 30 秒 prompt 拍出太阳系纪录片级预告片 — LudovicCreator · 2026-09-08