Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning
Hengyuan Xu, Wei Cheng, Yumeng Ji, Xuanyang Zhang, Xianfang Zeng, Gang Yu, Xingjun Ma
cs.CV
2026-08-27
Aphanta 用 Direct、真实编辑、理想参考三条件扫 20 个视觉任务。正面子集上 Qwen 管线从 0.343 升到 0.445,结构化外推的实际编辑经常掉分。
多模态大模型已经会在推理时裁图、放大、打标,也会让扩散模型另画一张图当「视觉草稿纸」。一张看起来合理的编辑图,不一定满足计数、关系、符号或反事实状态这些硬约束。把「理想中间图有没有信息增量」「当前编辑器能不能画出来」「下游模型有没有真用这张图」混在一次准确率涨跌里,结论会漂。
复旦和 StepFun 的 Aphanta 把问题收窄到固定链路:问题加原图 → MLLM 写编辑指令 → 指令编辑器出图 → 同一家 MLLM 再答。不问扩散模型会不会推理,只问当前通用指令编辑器在哪些任务上真能当视觉工作区。
每个任务跑三种条件,共用同一套打分:
Δedit = SB − SA 是整条管线的实用增益;Δref = SC − SA 是这张理想图有没有视觉余量。Δref 大而 Δedit 小或为负,就是实现缺口。C 不叫上界,真实编辑偶发会比构造参考更对下游口味。
任务发现是四阶段 agent 环(GPT-5.3-Codex 加人工过筛):提案、小样本 A/B/C 初诊、数据构造、编辑器训练与回评。20 个候选全部留在审计表里,停掉的和失败的也在。保留下来的编辑资源合成一个统一的 Qwen-Image-Edit LoRA,AdamW,学习率 1×10⁻⁴。同一条评估行可以切 Direct、Actual Edit、Reference,减少任务特化胶水代码。
A/B/C 测的是管线效用。B 多了一轮推理和一段编辑指令,涨分不能直接当成「返回的像素被用上了」。
20 任务里 4 个在初诊停掉(重复图案、视觉方程、齿轮、稀疏找不同),16 个进入后续,13 个留下可用管线。平面几何辅助线和流程图决策终评仍然帮不上忙。
按主导操作做描述性宏观平均(有完整 A/B/C 的任务;停掉的用初诊分):
| 操作 | Direct | 实际编辑 | 参考图 | 编辑Δ |
| 状态实现 | 0.283 | 0.580 | 0.813 | +0.297 |
| 线索注入 | 0.195 | 0.365 | 0.520 | +0.170 |
| 定位 | 0.673 | 0.773 | 0.758 | +0.100 |
| 结构化 | 0.473 | 0.404 | 0.556 | −0.069 |
单任务更刺眼。模拟时钟 0.50→0.81(参考 0.84);物体删除 0.10→0.47,参考已到 0.92,实现缺口还很大;密点计数 0.05→0.23。电路图 0.70→0.60(参考 0.88),齿轮 0.92→0.42,流程图 0.36→0.22,编辑在伤害准确率。反事实任务大约涨 0.21 到 0.37。
在筛过的正面任务子集上,Qwen3-VL 加自训 Qwen-Image-Edit 从 0.343 到 0.445(+10.2 点,相对 +29.7%),参考 0.558。同家族对照:Seed +3.5,Gemini-3 加 Nano Banana 2 +4.5,GPT-5 加 GPT-Image-1.5 −5.0。固定 Qwen3-VL 只换编辑器:自训 Qwen +10.2,GPT-Image-1.5 +8.7,FLUX.2 Klein +3.7,Seedream-4.5 −4.7。没有一个编辑器通吃所有操作。
迁到 Aphanta 没选过的 BabyVision 和 MIRA,实际编辑在 BabyVision 上三条管线全掉分;MIRA 只有 Gemini 有 +0.0092 的微弱正 Δ,三条参考条件都高于 Direct。协议能标出余量,现成编辑器在外部基准上还接不住。
给「用图来想」降温到一张可测的任务地图:线索注入、定位、反事实状态值得接编辑器;要精确符号、拓扑、几何辅助线时,先别接。系统侧含义很具体:按任务选、生成后校验、不可靠就丢掉。失败任务留在表里,避免只展示能涨分的 demo。
这是渐进的测量工作,不是新的编辑器榜单。正面子集上的 +10.2 不能外推成全任务成绩。
Phase-2 按余量筛选会抬高保留子集的增益,论文把 20 任务全表和正面子集分开报。操作标签有重叠,宏观平均不是总体估计。A/B/C 解释不了像素因果,缺 matched second-pass、只调用不回图、假图替换这类对照。闭源编辑器只能当评估当时的产品快照。外部基准上的负迁移说明,这张地图还不能套到任意视觉推理套件。Agent 提案加人工过筛,任务宇宙本身已经被选过一遍。