VIEScore 与人类评分相关性仅 0.3,低于人与人一致的 0.45
le_james94 · x · 2026-09-22
- 作者提出图像生成评测的可信门槛:一个评委模型只有在"比人与人之间的一致性更一致"时才值得采信。
- 数据:VIEScore 搭配 GPT-4v 与人类评分的 Spearman 相关仅 0.3,而人类彼此之间为 0.45——评委模型还没跨过这道坎。
- 结论:在公开校准数据、证明跨过该门槛之前,分解式指标(decomposed metrics)仍然只是偏好打分,不构成客观评测。
所属事件:图像生成评测与模型考古:评测相关性与 C2PA 水印之困(2 条相关)→
「多模态」频道最新
- Qwen2.1 采样器实测:锁定种子横评多种组合出图速度 — FreeTheClanks · 2026-09-22
- Runway 扩展 Workflows:新增合成、Alpha、HDR、深度图节点 — runwayml · 2026-09-22
- Grok 风格角色图生成提示词打包成网页应用免费可用 — dejavucoder · 2026-09-22
- Hyper3D 推出 Agentic 模式:自然语言对话式生成可编辑 3D 模型 — hey_abusiddik · 2026-09-22
- MiniMax H3 实测:做出移轴微缩视频的完整工作流 — alisitskii · 2026-09-22
- Peter Diamandis 展示两部 AI 电影短片《SLINGSHOT》《THE GIFTED》 — PeterDiamandis · 2026-09-22