OpenVDN H3 单卡直播视频生成亮眼,但 Ref2VA 未训练、表情参考难复现
eesahe · reddit · 2026-09-07
作者实测 OpenVDN H3(支持 Live T2VA/I2VA/FL2VA 的直播视频生成工作,单卡即可运行),认为概念颇有前景,但注意到所有官方 prompt 示例都是 text2img 路径,工作也未针对 Ref2VA(参考图驱动)训练。
在 ComfyUI 实现(ComfyUI-VDN-H3)中测试 Ref2VA:角色设定图(character sheet)能被较好地捕捉,但特定表情的参考图(如螺旋眼 guruguru-me)无论怎么换 seed 都无法复现,即使基础模型本身能生成该表情。作者附了细节对比图,期待未来有针对 Ref2VA 训练的同类架构。
「多模态」频道最新
- MiniMax H3 视频总比要求长几帧?帧数网格机制全解析 — bennash · 2026-09-07
- Flux.2 Klein 9B 参考图身份漂移,复杂场景下人脸崩坏求助 — RecordEmbarrassed787 · 2026-09-07
- 结构化动效视频 Prompt 模板:从主题到成片一条龙 — aziz4ai · 2026-09-07
- Beeble AI 视效实测:火焰材质追踪仍需 ComfyUI 补色 — ssoissoi · 2026-09-07
- 开发者搭建测试场,试探 Gemini 的乐理与音乐教学能力 — pitaru · 2026-09-07
- HeyGen 开源 hyperframes:用 HTML 给 agent 渲染视频,星标 4.4 万 — heygen-com · 2026-09-07