Aphanta:诊断多模态推理的图像编辑中间态
Fudan-University · hf · 2026-08-28
Aphanta 是一种评估框架,旨在确定图像编辑产生的中间状态何时能提升多模态推理性能。它通过测试直接视觉状态、编辑器生成状态以及理想化视觉状态,在各类任务中进行评估,以诊断任务对齐的图像编辑中介。
「多模态」频道最新
- 实测 Magnific:两分钟生成多种风格 AI 图像 — charis_ai · 2026-08-28
- ComfyUI MiniMax H3 进阶指南:Ref2V 控制与 Turbo 优化 — Fun_Walk_4965 · 2026-08-28
- Miles-diffusion 推出 LoRA SFT 快速微调扩散模型 — ying11231 · 2026-08-28
- 用 Veo「种子狩猎」工作流一下午做出乐高版《宋飞正传》 — thrownblown · 2026-08-28
- Topview Motion Studio 上线:单条提示词生成产品发布动效视频 — HeyZoyaKhan · 2026-08-28
- MiniMax H3 实测:可生成高质量的时代穿越特效 — YentaMagenta · 2026-08-28