自创「先冻结服务再解题」法,Codex 首破 Terminal-Bench 零通过任务

Present-Quantity-813 · reddit · 2026-08-19

作者写了一个方法交给 Codex,通过了 Terminal-Bench 3.0 上的 ico-path-patch 任务——该任务公开记录中 59 次运行、横跨 11 种模型与 agent 配置,通过次数为零;作者所用的同款模型 gpt-5.6-sol(最大推理力度)公开记录中 5 次全败。作者的一次运行在 90 分钟限时内 19 项检查全部通过。

方法核心:该任务要求二进制逆向 + 热补丁,19 项检查全有或全无。关键差异在于 agent 不直接解题,而是先为任务构建一个小型服务并冻结,之后通过这个服务解题,避免每过几轮就重新推导约束。

动机:长运行中 agent 对自身状态的认知会逐渐偏离实际位置。作者在运行自己的多智能体系统时总结出这套漂移理论,并因系统内一个 agent 自发用该理论诊断自身漂移而将其固化为方法。

作者的态度:欢迎他人复现——可用自己的技术栈跑(更能说明问题),也可用作者的免费步骤;作者自己尝试 4 次才通过一次,且没有「只给构建阶段、不给方法文本」的对照运行,因此「任意构建阶段都有效」这一替代解释尚无法排除。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →