397B 提示增强模型 WanPE 让 30 秒视频生成偏好飙升 50.86 分
Yubo Zhu · hf · 2026-09-25
WanPE 是一个 397B 参数的提示增强模型,在 105 万真实视频上训练,专攻导演级电影化分镜规划,为现代文生视频服务提供文本侧能力。
- 方法:通过视频接地逆向构建生成镜头级分镜方案,用 Semantic-Consistency GRPO(SC-GRPO)跨镜头保持用户语义一致
- 评测:配套发布人工标注的 WanPEval(覆盖 5–30 秒、不同意图粒度),辅以约 1.1 万次盲测成对比较
- 结果:驱动 Wan3.0 视频生成器时,5–15 秒场景人类偏好较原始提示提升 10.66–18.84 分,30 秒场景大幅提升 50.86 分;在 5–15 秒区间超越所有受测商业产品,30 秒区间与 Seedance 2.5 相当
- 消融:逆向构建明显优于正向改写,SC-GRPO 在各模型规模上都能稳健保持语义保真
「多模态」频道最新
- 同一 prompt 复测:Opus 5.5 一次生成完整视频,博主称真·one shot — drrickio · 2026-09-25
- 给 Claude Agent 接 Runway MCP,一条提示词产出 Netflix 风格纪录片 — CurieuxExplorer · 2026-09-25
- Seedance 2.5 携手 GPT Image 2.5,一镜搞定科幻经典对决 — CurieuxExplorer · 2026-09-25
- Opus 5.5 纯代码写歌做 MV,开发者做成 13 曲风选歌游戏 — pbaylies · 2026-09-25
- 研究:推理并非总有用,15.7% 案例反而拉近难负样本 — _reachsumit · 2026-09-25
- Qwen-Image-2.1 出 GGUF 量化版,骁龙865手机或可跑文生图 — ResidentAping · 2026-09-25