Praxist: From Experimental Artifacts to Solution Lineages
Jin Li, Ahmed Murtadha, Zhiyu Wang, Qiwen Chen, William Chen, Yifei Wu, Guan Wang, Andy L. Siy, Jiayi Yang, Mengsha Huang, Wenhao Li, Yixuan Liu, Shuailin Pan, Mingli Yuan, Sen Song, Yuhao Sun
cs.MA, cs.SE
2026-08-27
Sapient Intelligence提出Praxist,把每次实验做成可继承的类型化证据谱系。75题MLE-bench拿60枚奖牌(49金),模型花费3054美元,约为Claude Code + Opus 4.8的十二分之一。
自主研发代理已经能写代码、跑实验、按外部评分改方案。卡住的地方是战役怎么记。现有系统大多把状态保存在候选解的搜索树上:每次尝试留下日志、记忆和分数,但不标明是哪个设计要素带来了提升、证据有没有过验证、能不能跟别的机制重组。长跑因此反复重学同一课。
装配理论给了一个不同的原语:复杂对象由可复用部件的形成史构成,选择决定哪些部件留下来。Praxist 把这件事做成系统要求,叫做证据继承。评测结果不能当原始流水账往下传,必须先标出操作角色:成熟父本、待验证候选、该避开的失败、该记住的约束。
Praxist 把一场战役做成代际循环:产物、发现、前沿、议程、谱系。一代开始时,分配器给每个并行 peer 一份设计合同。Deep Innovation Gate 要求先写清要测的机制、改动面、父谱系、证据签名和验证钩子,再允许写代码。Quantified Diversity 把合同铺到不同的设计格子里(机制族 × 干预面 × 意图),避免整代人挤在当前最好看的一个方向上。
Peer 只做本地实验:按合同构造可复现产物,由任务自己的外部评测器打分,再对照合同意图抽成类型化发现(正向、负向、诊断、不确定、程序性)。失败是一等证据,后面几代继承的是约束,不是再踩一遍坑。
代际边界上做全局合成。PI 小组从 Builder、Skeptic、Portfolio 三个视角读这一代发现,高风险模式再加 External-validity;Chair 把备忘录和更新后的前沿合成下一代议程:继续、停止、验证、探索。前沿分成 confirmed、candidate、diagnostic、validation 四条车道,未成熟证据(smoke/scout)进不了 confirmed。跨代课可以压成 Gems,默认关闭;四个案例里只有量化交易开了,每 6 代压一次、最多 4 条活跃。整场跑完交两样东西:confirmed 车道上分数最高的产物,以及全程谱系账本。
主评测是 MLE-bench 全部 75 题,本地单次扫描,官方 grader 打奖牌。Praxist 的研究代理是 deepseek-v4-pro(1M 上下文),每题最多 20 代、每代 12 个 peer;对照是同一套 harness、同一批 H100 上的 Claude Code + Opus 4.8(最大 thinking)。
| 系统 | Any Medal | 金/银/铜 | 模型花费 |
| Claude Code + Opus 4.8 | 55/75(73.3%) | 34/16/5 | 38,370 美元 |
| Praxist + deepseek-v4-pro | 60/75(80.0%) | 49/10/1 | 3,054 美元 |
分档 Any Medal:Low 90.9% 对 81.8%,Medium 81.6% 对 76.3%,High 60.0% 对 53.3%。70 道两边都出分的题上,基线原始分更好的有 36 道,Praxist 33 道,1 道平。优势集中在奖牌档,不在多数头对头分数。内部完整性审查剔除了 90,423 次受污染尝试,9 题整条谱系被换掉。Claude Code 侧有 5 题因严重作弊筛查未计分。
四个开放案例走同一套循环。
火箭着陆:冻结 6DoF 仿真上,选中的确定性控制器在 12,288 条轨迹上 100% 成功;起点产物 4.03%,同一任务上的 Weco 代码优化器报 17.12%。花费 196 美元对 1,010 美元。Weco 可改任务清单、底层模型也不同,论文把它标成外部参照而非配对对照。
量化交易:2019Q1–2025Q4 共 28 个 walk-forward 窗口,LSTM-PPO 策略日历 CAGR 53.07%,等权基线 22.80%。但这份产物停在 incubator 车道(单种子、三项硬约束违规),confirmed 车道上另有一条更干净、CAGR 更低的注意力策略。数字是按指标事后挑的,不是战役自己晋升的冠军。
SLAM:在 FAST-LIVO2 上加视觉调度器 CovSched,14 条 NTU-VIRAL 序列的评测器捕获视觉路径时间平均降 72.4%。APE 列是 0.0937 m 对 0.0501 m,但两边位姿时间戳约定不同,重关联后门控几乎消失。论文明确不报精度提升。
托卡马克磁控:相对 MAST-U PCS 风格控制器,聚合存活 1,264/1,500 对 1,222,公共地平线跟踪误差 2.86 对 2.99;全地平线误差 4.65 对 4.42,PCS 更好。官方通过线一条都没过。对照在特权状态 harness 内。
给从业者的信号很具体:长程研发代理的瓶颈经常不在「再写一轮代码」,而在评测结果有没有被标成可重组的机制。Praxist 把这个接口做成产物级谱系,并放出实现和各次运行的代际账本。
成本对比不能直接当「同一模型下系统赢了 12 倍」读。两边底座不同,Praxist 用 DeepSeek,基线用 Opus 4.8。仍有信息量的是:用更便宜的模型,配上代际继承和类型化前沿,奖牌率和含金量都高于更贵的单代理扫描,金牌占比 81.7% 对 61.8%。如果你已经有外部评测器(Kaggle 式提交、控制器仿真、策略回测),这套循环比再堆一个搜索树更接近可持续工程。
如果只看原始分,这是一次渐进的阈值优化,不是全面压过对照。
论文自己划了边界。MLE-bench 是单次本地扫描,不是官方多 seed 排行榜;差距应按「这一次协议下的全套结果」读,不能当方差估计。火箭银行在战役中自适应复用,存在选择过拟合;评测停在首次触地、用精确状态反馈、低阶冻结仿真,不声称真实着陆可靠性。量化那条 53% CAGR 没过晋升门。SLAM 的精度列被时间戳混淆主导。核聚变两边都读 harness 里的目标误差,不是探针观测。
缺一块对照:同一底座模型上,Praxist 对朴素多尝试或搜索树的消融。没有它,无法把奖牌差从模型差、调度差、审查规则差里拆出来。Gems 默认关闭;PI 面板在默认配置里也是关的。谱系作为交付物在四个案例里写得很细,MLE-bench 75 题只报了分级结果。