多轮改论文插图会漂质量、会忘需求,多目标批评能压住

PaperBanana-Interact: Scientific Diagram Refinement with Multi-Turn Human Feedback

Xueqing Wu, Ashwin Balasubramanian, Bingxuan Li, Dawei Zhu, Kai-Wei Chang, Yale Song, Yiwen Song, Rui Meng, Tomas Pfister, Nanyun Peng

cs.CL, cs.CV

2026-08-31

Google与UCLA等提出MTPaperBananaBench:292张图、3518条需求,用模拟用户做多轮改图。基线会质量漂移和遗忘。PaperBanana-Interact用多目标批评循环把质量分提高11.9到18.6,遗忘率下降3.7到6.2个百分点。

这篇在解决什么

单轮从论文正文生成科学插图已经有PaperBanana、AutoFigure这类系统。作者的视觉偏好很难一次说清:14人的形成性研究里,所有人都在看完初稿后继续改,86%觉得改完更满意,均分从3.2到4.2。64%的场次里,初稿本身改变了他们对图该怎么画的判断。需求是看着图长出来的。多轮工作流几乎没被系统评过。

方法

先做基准。MTPaperBananaBench从PaperBananaBench的专家原图里抽出设计选择,经Gemini候选再人工修订,得到292张图、3518条需求,平均每图12条,覆盖内容、组织和视觉编码,Cohen's κ为0.767。评测时用模拟用户:每轮对照隐藏需求列表,找出未满足的,把前k条翻成自然语言反馈,最多5轮。主指标是需求满足率和相对人工参考图的质量胜率,另报当轮满足率和遗忘率。

基线分两类。生成模型(NanoBananaPro、GPT-Image-2)直接按最新图和全部用户话编辑。PaperBanana-DirectRefine只改上一轮的绘图提示再渲染。两者单轮都能听指令,NanoBananaPro当轮满足率56.2%,DirectRefine 68.6%,但多轮会垮。

PaperBanana-Interact加了三块。摘要器把多图历史压成文本记忆,记下每版画了什么、相对上一版改了什么、是否对准当轮请求。内部循环里,多目标批评器按当前请求、全部历史请求、对原文的忠实、版式质量逐条出结构化批评;精炼器改提示,可视化模型重画,直到批评器认为可以停或用尽最多10次内部迭代。

结果

k=1时,以PaperBanana单轮稿为起点:

精修器质量↑需求满足↑当轮满足↑遗忘↓
单轮(不精修)50.325.2
NanoBananaPro19.045.256.219.0
DirectRefine47.152.668.618.8
Interact61.258.077.212.6

NanoBananaPro质量从50.3掉到19.0。DirectRefine需求上去了,质量仍低于单轮。Interact是唯一质量和需求一起升的。k=3时质量漂移更重,Interact仍把质量从单轮50.3抬到54.5,DirectRefine掉到42.6。人工 pairwise 里Interact相对NanoBananaPro和DirectRefine的胜率是81.3%和76.7%。消融显示内部迭代从10收到1,质量从61.2掉到43.5,遗忘从12.6升到16.8;拿掉历史记忆,遗忘从12.6升到14.7。

为什么重要

给科研绘图工具指出了单轮生成够用、多轮编辑不够用的具体失败模式:质量漂移和遗忘。多目标批评加压缩记忆是可复用的修法,不一定绑在科学插图上,任何「上一轮改对的细节下一轮被覆盖」的图像编辑都能套。模拟用户让这条评测能反复跑,不必每次请14个作者。

增益是工程性的。骨干仍是Gemini-3.1-Pro加NanoBananaPro,换的是工作流。

局限与存疑

遗忘没有清零,最好仍有10%到13%。模拟用户能看到评委的失败理由,比真人反馈更干净,真实对话会更含糊。需求和质检都用Gemini家族,和生成器同族,κ=0.812说明和人接近,仍有自审偏差。形成性研究14人全部来自同一机构。AutoFigure因为单轮太弱被排除在多轮之外,对照集不完整。工具被明确写成辅助系统,科学事实上的对错仍要人看。

术语

原文与代码

社区讨论

相关论文

全部论文解读