视频理解模型挑战镜像反射场景频发幻觉
测试表明,当前的视频理解模型在处理复杂视觉场景时仍存在明显局限。有测试者使用带有镜像反射的AI生成视频评估GPT-4o、Gemini等主流大模型,发现它们在面对反射画面时频繁产生幻觉,甚至出现自相矛盾的描述。这表明,尽管大模型不断迭代,但距离真正“看懂”复杂视频仍有较大差距,亟需进一步提升空间理解能力。
2026-07-21 ~ 2026-07-21 · 2 条相关
- 镜像反射视频一测就幻觉,作者称视频理解模型仍不够用 — venturetwins · 2026-07-21
- 视频理解模型在镜像反射里仍会幻觉和自相矛盾 — Kyrannio · 2026-07-21