Simulation-Aware In-Context Policy Improvement for LLM-Aided Analog Layout Refinement
Bingyang Liu, Ziming Wei, Xiaohan Gao, David Z. Pan
cs.AI, cs.RO
2026-08-14
UT Austin用GPT-5多代理在MAGICAL版图生成器上做上下文策略改进,约11次后仿就把两颗运放的FoM打过启发式和贝叶斯优化。
模拟集成电路的版图到现在仍是「生成一版、抽寄生、后仿、再拧旋钮」的人工循环。ALIGN、MAGICAL 这类端到端生成器能吐出第一版可过 DRC 的版图,但真正决定开环增益、单位增益带宽、共模抑制比的,是网权、器件偏置、对称约束、布线优先级和线宽。这些旋钮在工具里常常被冻成一套通用启发式,换电路、换指标就对不上。
贝叶斯优化在前端尺寸问题上已经常用,落到版图层却要成百上千次评估,每次都是寄生抽取加后仿。工业预算往往只有几十次。更早的 LLM 版图助手多半拿自然语言描述几何,状态含糊,经验也没法在同一颗电路上跨轮累积。UT Austin 这篇把问题收窄:在 MAGICAL 派生生成器上,用冻结权重的 in-context policy improvement(ICPI,不改模型参数、只靠上下文更新策略),在约十次后仿预算里把那组旋钮拧过规格。
动作空间不是改多边形,是生成器暴露的五族布局布线参数:网权、放置偏置、对称约束、布线优先级、线宽。组合量仍然很大,所以先用一次性 Analyzer 读网表,拆功能块,标出失配和寄生敏感的器件与网,给后续搜索剪枝。这步只跑一次。
真正干活的是三代理 act-observe-reflect 环。Supervisor 看当前 layout state、Analyzer 提示和 design journal,每轮只选一族参数并给出高层目标,比如加强某对管子的匹配,或给关键网更高布线优先级。Executor 把目标译成具体数值再调生成器;对称过紧或线宽过猛导致合法化、布线失败时,按失败日志回退到附近可行点,不把电学上已经死掉的候选交出去。Reflector 把本轮状态、动作、结果压成一条 journal,供后续检索。
layout state 是给 LLM 看的压缩几何:器件坐标与连接、当前参数、寄生摘要、后仿指标。不喂原始多边形,也不喂版图截图。所有代理共用 GPT-5,角色靠提示词分开。权重始终冻结,策略改进全部发生在上下文里。
基准是两颗真实运放。OTA1 是 65 nm 两级 Miller 补偿,指标 Gain ≥50 dB、UGB ≥18 MHz、CMRR ≥80 dB、PM ≥60°。OTA2 是 40 nm 全差分带共模反馈,Gain ≥60 dB、UGB ≥1.5 MHz,其余两项相同。对照三条基线:生成器内置启发式、同一动作空间上的贝叶斯优化、去掉 journal 和跨轮反思的 Ours w/o ICPI。优化预算都是 31 个候选;完整方法每 3 轮才后仿一次,合计 31 次寄生抽取、11 次后仿;BO 每轮都要后仿,31 次全跑。
| 电路 | 方法 | FoM | 面积 (μm²) | 四项电学指标 |
| OTA1 | Heuristic | 0.869 | 3592.9 | 未过 |
| OTA1 | BO | 0.979 | 4036.9 | CMRR 54.89 未过 |
| OTA1 | w/o ICPI | 1.003 | 3288.3 | UGB 17.24 未过 |
| OTA1 | Ours | 1.104 | 4031.4 | 全过 |
| OTA2 | Heuristic | 0.696 | 7080.0 | 未过 |
| OTA2 | BO | 0.880 | 8857.3 | CMRR 62.80 未过 |
| OTA2 | w/o ICPI | 0.868 | 6490.5 | 未过 |
| OTA2 | Ours | 1.038 | 6468.2 | 全过 |
OTA2 的动作空间大约比 OTA1 高两个数量级。同一 31 候选预算下,BO 把面积拉高超过 25%,CMRR 仍不达标;完整 ICPI 四项全过,面积还比启发式和 BO 都小。OTA1 上 BO 已经能把增益和带宽拉得很高,但 CMRR 崩到 54.89 dB;ICPI 走更均衡的点,FoM 仍最高。BO 还会交出电学上已经不起振的合法版图(FoM 记 0);ICPI 的非法点停在后端失败,回退后再提交,交出去的候选全部 LVS 干净且电学可工作。
代理编排每轮约 37–43 秒、12k–17k token,30 轮合计 18–21 分钟,输入上下文占 token 九成以上。寄生抽取加后仿的保守下界超过 141 分钟,LLM 编排占墙钟不到 16%。贵的仍是仿真。
这是把 Reflexion、Self-Refine 那套「冻结权重、靠记忆改策略」接到真实后仿闭环上。动作是生成器本来就有的旋钮,不是让 LLM 直接画版图。对已经在用 MAGICAL 类工具、后仿预算只有几十次的模拟后端,这套环路比 BO 更省仿真,也比纯自然语言交互更可归因。PDK 无关的合成环境演示已公开,方便换 backbone 复现机制。
它仍是渐进改进:内核还是 MAGICAL 的放置与布线,LLM 只是在旋钮空间里做样本高效搜索。换生成器、换更复杂的层次化电路,都还没验证。
作者自己写了:只测了两颗 OTA,状态表示和仿真成本会随规模恶化,层次化划分是后续工作。FoM 不惩罚面积,OTA1 的 ICPI 版图几乎和 BO 一样大,面积优势只在 OTA2 上成立。GPT-5 是唯一给出数字的 backbone,开源模型接口写了但没给结果。Analyzer 的剪枝质量没有单独消融,OTA2 上完整 ICPI 相对 w/o ICPI 的 FoM 从 0.868 跳到 1.038,有多少来自 journal、有多少来自 LLM 采样运气,单次运行看不出来。工业 PDK 与量产流程也还没接到。