质疑 Minimax H3 混合模型:参考图遵循能力弱于预期
Tablaski · reddit · 2026-09-01
作者分享了使用 Minimax H3 混合模型 (ref2va + fl2va 架构) 的负面体验。虽然理论上该架构结合了参考图遵循和高质量生成的优势,但实际测试中发现:
- 参考图不稳定:生成的视频很少严格遵循输入的参考图或起始帧,往往在开始后立即切换到无关内容,或者在开头插入随机图片。
- 效果存疑:即便使用关键帧引导,模型也经常丢失参考信息;作者未感觉到显著的质量提升,且即使关闭加速、增加步数问题依旧存在。
作者询问社区是否有相同体验,并指出此前关于 Spectrum 等技术的“无损”宣传也存在类似夸大现象。
「多模态」频道最新
- Krea2-SDA LoRA 修复生成多样性不足痛点 — Gradio · 2026-09-01
- 阶跃星辰 CE3D++:对话式编辑 3D 与 4D 场景 — stepfun-ai · 2026-09-01
- 仅 CPU 实现视频人物追踪与背景模糊方案 — Exotic_Accountant565 · 2026-09-01
- ABot-Recon 上线 Hugging Face:行车记录仪视频几秒变 3D 扫描 — petewoodbridge · 2026-09-01
- KATok 自适应视频 tokenizer:丢弃冗余 token 压缩视频表征 — kakaocorp · 2026-09-01
- DICS:利用数据内在一致性筛选视觉指令数据 — SpatialAxiom · 2026-09-01