Zero-Shot Self-Orchestration with Ledger-Based Control for Improved LLM Coding Performance
Victor Gao, Vida Khosrowshahi, Ali Khosrowshahi, Xihao Sun, Juhyun Lee, Simon, Lee
Sang Won
cs.MA, cs.AI, cs.CL, cs.SE
2026-08-27
同一模型加零样本脚手架,Qwen-27B在LCB-100从63.0到86.4,Terra五分之一价逼近Fable 5。
多智能体 LLM 系统常被说成能打赢单模型。证据其实参差,对照也经常搅在一起:token 预算、工具调用、提示词一起改,最后多出来的分数说不清是谁贡献的。
Persis Capital 这篇把对照收紧到一件事:同一个模型、同一套 100 道最新 LiveCodeBench hard 题,单次调用对上「manager + worker + 共享文件系统」脚手架。不训练,不按榜微调。他们把这套叫 zero-shot self-orchestration,零样本自我编排。要量的是只加一层编排,分数和账单各动多少。
状态不放在任何一次上下文里,全部落在共享工作区:题目、总计划、任务列表、累积笔记、当前最优代码。每个角色都是同一模型的一次全新调用,只通过这些文件交接。
流程是固定的短循环:
对照臂是同一模型、同一温度 0.2 的一次调用,没有工具、没有循环。
主结果走 pinned backend 和 v2:GPT-5.6 走官方 API,Qwen3.8-27B 走本地 vLLM,Fable 5 走 Anthropic。更早的一组另外五个模型走 OpenRouter 和更简的 original 脚手架,单独报,不混表。
主条件是 128k 输出上限、thinking 开、五次独立 pass。pass@1 如下:
| 模型 | 单次 | manager | Δ |
| Qwen3.8-27B | 63.0±4.1 | 86.4±2.7 | +23.4 |
| GPT-5.6-Luna | 67.2±4.3 | 77.8±2.0 | +10.6 |
| GPT-5.6-Terra | 77.0±1.0 | 85.0±1.0 | +8.0 |
| Claude Fable 5 | 87.4±1.1 | 未跑 | - |
三组组内 Δ 都过 p < 10^{-4}。manager 赢的题大约是输的四倍以上:Qwen 在 500 次 problem-pass 里 125 对 8,Luna 71 对 18,Terra 51 对 11。
账单大致乘三:Qwen 每 100 题从 $20.44 到 $51.75,Luna 从 $0.41 到 $1.50,Terra 从 $3.41 到 $11.71。Fable 5 单次就要 $61.11。
沿这条成本-精度线有三个可比的点。Terra 加脚手架 85.0,对 Fable 5 的 87.4,差 2.4 分不显著(p=0.59),价格是五分之一。Qwen 加脚手架 86.4,对 Fable 5 差 1 分(p=0.73),按 OpenRouter 标价 $51.75,比 Fable 还便宜 $9.36。Luna 加脚手架 77.8,对上 Terra 单次的 77.0,价格 44%。
Qwen 单次臂有一部分增益来自截断救援:128k 下 500 次里 150 次撞上限、35 次交不出代码;manager 把这 35 次里的 25 次做成对,贡献 +5.0 分,大约是 +23.4 的五分之一。两个 OpenAI 臂全程 0 次截断、0 次空答案,那两组 +8.0 和 +10.6 不含救援成分。
成绩单背后,transcript 里反复出现两件事。一件是上下文管理:每次 worker 只看计划、笔记、当前代码和这一步任务,短调用不容易写飞。Qwen 单次有过 675,000 字符推理、同一句话重复 7,743 次还交不出代码,manager 把工作切成短调用,答案才能落到磁盘。另一件是拆解:把双目标 DP 拆成两段,或先把引理写进笔记再动手。
OpenRouter 那组里,Opus-5 单 pass 从 85 到 91,是全文最高分,但只有一次。thinking 关掉后,Kimi-K3 在 16k 五次 pass 上 +30.4,128k 单次 +42;Minimax-M3 分别 +11.0 和 +12。Qwen3.6-35B 关掉 thinking 后不涨甚至倒退:16k −1.2,128k −9。
对要上代码 agent 的人,这篇给的是可直接套的、不训练的编排层,以及一张还算干净的账单。弱模型和关 thinking 的模型从脚手架里拿得最多;强模型开着 thinking,增益收成几个点,但账单仍常常比换更大模型便宜。
它没有声称多智能体在等 token 预算下更信息高效。循环必然更贵,问题是这笔钱买不买得过换模型。按他们的数字,很多时候买得过。
脚手架会帮倒忙。Qwen3.6-35B 有一道题,单次写出正确的凸包优化 DP,brainstorm 却以「CHT 复杂易错」为由改成更慢的 O(n³),还写错。关掉 thinking 后这台模型整体不涨。
Fable 5 没有 manager 臂,最强单次结果恰好缺对照。Qwen 的 128k 单次是 250k 生成事后截断回放,模型事先知道更紧预算时会不会早点收笔,这篇测不到。v2 的样例验证只覆盖 73/100 题。全部数字都在竞赛编程上,数学和知识题探过,前沿模型已经贴天花板,没正式报。
OpenRouter 那组把网关故障记成答错,绝对分是下界;headline 所以改走 pinned backend。实验也不是等 token 对照,和 Tran & Kiela 那条「等 thinking token 时单智能体不输」的结论不在同一坐标系。
他们还修了 LiveCodeBench 评测器一个真 bug:sys.stdin.buffer.readline() 的 mock 每次都返回第一行。§2.1 里 311/3456 份代码踩中这个写法,其中 97% 被错判;Fable 5 一次都没用,分数小数点都不动。风格不同的模型会被静默惩罚。