meta-harness递归改写设计流程,AI海报打分反超商用系统7.45分

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li

cs.CV, cs.AI, cs.CL

2026-08-14

AutoDesign让编程agent自己迭代改写生成论文海报的整套流程,不改模型权重,PosterBench打分从54.99提到67.39,反超Claude Design 7.45分。

这篇在解决什么

把论文、报告这类多模态素材转成海报、幻灯片、视频这类人类可读的产出物,本质是一个跨越很多步骤的agent任务。理想情况下,承载这套生成流程的harness(提示词、工具、评估反馈这套系统)应该能从每次生成结果里学到东西,越用越准。但现有系统大多是一次性写死的静态流程,不会自己积累经验。这篇论文要解决的问题是:能不能让一个coding agent反过来去优化产出内容的harness本身,而不是每次都优化单张海报。

方法

AutoDesign设计了两层嵌套的循环。内层是设计harness本身:一个designer模块生成或修改海报,一个critic模块(规则校验加视觉VLM打分)给出反馈,循环若干轮直到通过或用尽12次尝试预算。外层是meta-harness:把设计harness当成优化目标,在训练任务集上跑一遍当前harness,收集所有生成结果和评分,再让一个coding agent(身兼规划者和代码编辑者两个角色)分析失败模式,提出对harness某一个功能组件(上下文管理、工具规格、执行运行时、编排逻辑、评估反馈,五选一)的一次改动。

关键的约束是验收门:候选改动只有在训练集上分数确实提高、并且在独立的开发集上分数没有下降时才会被采纳,否则直接丢弃、保留原harness。每轮改动只能动一个组件,这样任何一次分数变化都能明确归因到具体哪个改动,而不是好几个改动叠在一起分不清谁的功劳。人类可以在评估被VLM系统性漏判某类偏差时插手修正评估器,也可以用自然语言给优化方向指路,但不能直接改harness代码本身。

结果

论文用论文转海报生成任务(PosterBench,100篇论文、五个学科)做验证,七维度评分(忠实度、覆盖度、密度、视觉证据、排版、可读性、美观度)。

系统PosterBench总分
AutoDesign(Claude Code+Claude 4.8)78.32
AutoDesign(Codex+GPT-5.5)77.97
Claude Design(同配置对照)70.87
OpenDesign(同配置对照)69.45

在Claude Code+Claude 4.8这套相同配置下,AutoDesign比商用系统Claude Design高7.45分。控制变量实验里,把学出来的DesignHarness接到七种不同的模型/coding agent组合上,平均分从54.99涨到67.39,涨幅5.0到19.6分不等,DeepSeek V4 Pro这类相对弱的模型涨幅最大(19.6分)。11名审稿人做盲评,936次两两对比里AutoDesign的Bradley-Terry胜率估计是64.0%,分差20分以上时,人类偏好和PosterBench打分的一致率达到74.4%。全自主长程流程下,单次生成执行253次工具调用、11轮编辑,40分钟内、不到3美元完成一张达到会议海报水准的作品。

为什么重要

这篇的核心思路,把优化目标从这次产出好不好挪到生成这次产出的系统好不好,对任何要长期运营agent产出内容的场景都有参考价值,不只是海报。它给了一个具体可复制的工程配方:验收门(训练集涨分加开发集不降)加每次只动一个组件的归因约束,这两点解决了自我改写agent里最容易翻车的两个问题——局部改进悄悄拖垮别的任务,以及改动堆在一起没法回溯是谁的功劳。而且优化对象是harness不是模型权重,同一套学出来的DesignHarness能直接套到七种不同底层模型上都有效,说明学到的是可迁移的流程经验,不是针对某个模型的补丁。

局限与存疑

论文自己承认PosterBench目前只验证了海报这一种产出形式,幻灯片、网页、视频这些meta-harness理论上也支持的格式并没有被同样严格地评测,只有示意性的4x4案例展示。验收门只保证不比训练集/开发集差,但训练集和开发集都来自同一批100篇论文构成的分布,harness是否能泛化到差异更大的论文风格(比如非英语论文、极短的workshop论文)没有测试。人类盲评的胜率区间是55.2%到77.8%(95%置信区间),跨度较大,说明样本量(11名审稿人、936次判断)对精确量化优势幅度还不够。此外meta-harness的优化器本身用的是Claude Code这类现成coding agent,论文没有讨论换成更弱的coding agent来做优化器时,整套自我改进流程是否还能跑起来。

术语

原文与代码

社区讨论

相关论文

全部论文解读