MiniMax-H3 物理世界推理评测:517 例总体成功率仅 41.97%
Haoyu Zhao · hf · 2026-09-18
一项针对全模态生成模型 MiniMax-H3 的评测工作,检验其能否对物理世界进行推理。
- 评测框架围绕四个维度设计,利用全模态输入构造新任务:隐式提示配多帧、音频-图像、前缀视频、音频-视频组合,每种模态只提供部分证据,要求模型跨模态联合推理出隐含事件状态与未来动态。
- 在 517 个评测实例上,MiniMax-H3 总体成功率 41.97%:基于视频的决策推理最高(56.00%),基于音频的消歧推理最弱(仅 27.40%)。
- 结论:有效的多模态整合仍是发挥全模态输入价值的关键。项目开源在 GitHub(gulucaptain/MiniMax-H3-Reason)。
「多模态」频道最新
- 拆帧+分镜复刻法:用 MiniMax H3 精确还原视频四步工作流 — Negative-Whereas3307 · 2026-09-18
- 开发者造出每天发新歌的 AI 歌手 Will,人格记忆随反馈成长 — kun101 · 2026-09-18
- Kijai 新版 MH3 VAE 省显存:RTX 3060 12GB 也能跑 1MP×10 秒视频 — Chiduk99 · 2026-09-18
- MiniMax Design 更新:支持自定义模型,年付立省 20% — Hailuo_AI · 2026-09-18
- 演示:GPT-6 Astra 经 MCP 直接在 DaVinci 里剪辑视频 — toolstelegraph · 2026-09-18
- 用结构化 prompt 让 Nano Banana Pro 复刻漫画角色富江 — creatoroff · 2026-09-18