实测四大视频模型:MiniMax-H3 提示词遵循最佳,Wan 2.2 翻车
Neither_Win3637 · reddit · 2026-09-02
Reddit 用户以「跳芭蕾舞者」为统一提示词实测多款视频生成模型:
- MiniMax-H3:提示词遵循最佳,小段提示也能准确生成,综合表现最好。
- LTX-2.5:叙事和国籍特征把控不错,但需约三段超长描述才能稳定;存在撕裂、面部畸形、缺腿、镜头漂移等已知问题。
- Wan 2.2:完全翻车,渲染和撕裂问题严重,转体时头和身体分离,观感诡异。
- Cosmos3:据称动作可以,但生成人物不行。
作者询问是否存在能同时做到国籍准确、五官稳定、旋转不崩的开源权重模型。
「多模态」频道最新
- 语音 AI 都在喊“表现力”,但它到底怎么定义和评测? — SIGKITTEN · 2026-09-03
- Inworld Realtime TTS-2 正式发布,登顶 Artificial Analysis 速度榜 — Scobleizer · 2026-09-03
- DramaChain Bench:短剧生成全流程基准,专测级联缺陷 — Haoyuan Shi · 2026-09-03
- VibeComfy 联动 Hivemind:让 CLI agent 真正读懂并操作 Comfy 工作流 — PetersOdyssey · 2026-09-03
- 7 个月 240 张图实测:同一 AI 角色面部漂移嘴宽 11%、痣消失 — No_Issue_8224 · 2026-09-03
- Inworld TTS 正式 GA,CEO 访谈拆解语音成 AI 默认界面之路 — agihouse_org · 2026-09-03