PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments
Yuhao Zhan, Bingxiang He, Zecong Tang, Chaojun Xiao
cs.AI
2026-08-15
清华 PACE-Bench 给 36 个物理任务造 144 对源-目标环境(摩擦、材料、动力学被系统性突变),源设计过关目标必挂,agent 要在 20 次尝试内从沙盒诊断反馈里改出可用设计。最强组合 Reflexion+Qwen3-14B 只过 35.9%,直接告知改了什么参数也抬不了上限。
自进化 agent(从交互经验里改自己的参数、上下文、记忆或工具的那批方法)的现有评测有个共同盲区:执行条件是固定的。StreamBench、LifelongAgentBench 测跨任务流上的累积,SE-Bench 测迁移,都没测过「环境变了,原来能跑的设计废了,agent 能不能把它救回来」。而这恰是部署里最常见的事:路面从水泥变成冰,车的设计就得改。
物理仿真给了受控试验场:改摩擦、材料强度、动力学参数,可以在不动任务目标的前提下精确废掉一个能用的设计。代码给了可执行的修改接口:改完能在沙盒里跑、能拿到失败诊断。
每个任务从一份代码驱动的设计起步,它在源环境里通过。系统性突变物理参数造出目标环境,保证源设计在目标必挂、但一份验证过的参考设计能过。36 个基础任务(六域:静力学、运动学、动力学、流体、控制、奇异物理)× 每任务 4 个源-目标对 = 144 对,难度从 Stage 1 到 Stage 4 递增(突变参数 2 个到 10 个)。任务平均 1051 token 提示、7 条硬约束、8 个原语 API。
流程是标准的 adapt 循环:提交设计、沙盒跑、拿诊断反馈(失败时间戳、约束裕度,只说哪里挂、差多少,不给修法)、改代码重提,预算 20 次尝试。构造质量有三 phase 把关,两位物理/工程背景作者三遍审,中重度问题率从首遍约 86% 降到第三遍 0。
对比对象是四范式十方法:上下文类(Reflexion、Self-Refine)、记忆增强类(ACE、ExpeL、ReasoningBank)、推理时搜索(ToT、CodeEvolve)、参数类(SEAL、RAGEN、TTT-Discover),主实验跑 Qwen3-4B/8B/14B。指标 Pass@2(两次独立运行至少一次成功)加 Score@2。
| 方法(Qwen3-14B) | Pass@2 | 相对 Vanilla |
| Vanilla | 32.0% | - |
| Reflexion | 35.9% | +3.9 |
| ToT | 20.3% | -11.7 |
| Self-Refine | 7.1% | -24.9 |
| CodeEvolve | 5.3% | -26.7 |
| ExpeL | 15.6% | -16.4 |
三条主线结论:
前沿模型这边,Statics 子集满预算下 GPT-5.5 也只 66.7%,DeepSeek-V4-Pro 45.8%,Qwen3-32B 对 14B 零提升(37.5% 持平),家族内平台期出现。从零构建(不给源设计)Pass@2 只有 11.318.3%,源环境直接过 32.3% 对目标环境 6.413.4%,突变确实制造了难度。
对做工程 agent(代码生成、CAD、自动化设计)的人,这篇最有用的是失败分类学:Design Fixation、Stagnation、Exploration 这些标签可以直接拿来诊断自己的 agent 在哪卡住。固守型该注入多样性,乱走型该加收敛压力,而 Self-Refine 的结果说明没有外部验证器的自我修订是负资产。
「CE 不抬上限」这条对 agent 方法论是个重要锚点:如果告知确切参数变化都救不了机制重设计,那 parameter inference 和 mechanism redesign 是两种不同的能力,现有自进化方法练的是前一种。
主实验模型最大到 Qwen3-14B,前沿闭源模型只在 Statics 子集的 24 对上测了 Vanilla,十方法 × GPT-5.5 的完整交叉缺失,「自进化方法对强模型是否有效」这个最实操的问题数据不足。144 对全部来自 Box2D 二维物理,三维、刚体、真实工程约束的推广未验证。诊断反馈格式(时间戳 + 裕度)是一种特定设计,换成自然语言失败描述或视频反馈结论是否会变,论文自己的 VLM 视频反馈实验显示上下文类方法反而受干扰(Reflexion 40.9%→27.3%),说明结论对反馈模态敏感。Pass@2 只跑两次独立运行,对 35.9% 这种量级的成功率,抽样噪声不小,论文未报置信区间。