POV 视角生成成图像模型新能力,开源方案集体翻车
PangolinAdmirable881 · reddit · 2026-09-14
Reddit 用户发现 Meta Muse Image 和 Nano Banana 等闭源模型能根据输入图片生成特定人物视角(POV)的图像,但成本太高无法大规模使用。作者尝试的开源替代全部失败:
- 开源图像模型:Qwen Image Edit、FLUX.2 9B Base、Hunyuan Image 3.0 Instruct 均无法从图中特定人物视角生成画面;
- 视角描述法:用 Gemma 4 生成「该人物看到了什么」的描述,结果它转而去描述人物本身而非视角内容;
- 视频模型改机位:用 Wan 2.2 TI2V 指令切换到人物视角,同样失败(尚未测试更大的视频模型)。
帖子里作者向社区征集更多模型或提示词技巧,评论区可关注后续方案。
「多模态」频道最新
- Minimax 视频 seed 换参数即失效,创作者苦寻低分辨率预筛法 — fluce13 · 2026-09-14
- Midjourney V8.2 新风格亮相,出图效果引围观 — azed_ai · 2026-09-14
- OpenAI 高管用 Codex 内 Astra 3D 重现马里奥城堡并生成飞越视频 — romainhuet · 2026-09-14
- ComfyUI 插件 SmartSave 用本地 Ollama 自动按主体归类出图,已开源 — Cold-Worldliness5392 · 2026-09-14
- MiniMax Design 经 MCP 接入 Blender,3D 参考驱动 AI 视频制作 — Hailuo_AI · 2026-09-14
- 用 Seedance 2.5 把上学早晨拍成潜行游戏,节奏运镜惊艳 — SimplyAnnisa · 2026-09-14