Physics-IQ 审计发现:三分之一提示词歧义,30% 视频抬高分数
DynamicWebPaige · x · 2026-07-25
一项新的 Physics-IQ 审计 发现,所谓“物理准确”的视频模型表现,很大程度取决于基准本身是否靠谱。研究指出,超过三分之一的提示词存在歧义,并且大约 30% 的视频 带有会抬高分数的伪影。
在清理这些问题后,模型排名出现了明显变化,相关系数报告为 τ = 0.46。结论很直接:评测视频生成模型时,感觉像物理 并不等于 真的懂物理。
所属事件:Physics-IQ 审计揭示视频模型物理基准存在严重缺陷(2 条相关)→
「多模态」频道最新
- GlobalGPT 通过 MCP 把视频生成接入 Codex — HeyNayeem · 2026-07-25
- GlobalGPT 把视频生成带进 Codex 的 MCP 工作流 — HeyNayeem · 2026-07-25
- GlobalGPT 图像生成已通过 MCP 接入 Codex 工作区 — HeyNayeem · 2026-07-25
- GPT Image 2 提示词把产品海报做成负空间构图 — aziz4ai · 2026-07-25
- 拍张菜单照片,1 分钟完成整套重设计 — cantrell · 2026-07-25
- Gemini 生成三段 10 秒视频后重置,长片连续性被打断 — Status_Engineer6674 · 2026-07-25