自创「先冻结服务再解题」法,Codex 首破 Terminal-Bench 零通过任务
Present-Quantity-813 · reddit · 2026-08-19
作者写了一个方法交给 Codex,通过了 Terminal-Bench 3.0 上的 ico-path-patch 任务——该任务公开记录中 59 次运行、横跨 11 种模型与 agent 配置,通过次数为零;作者所用的同款模型 gpt-5.6-sol(最大推理力度)公开记录中 5 次全败。作者的一次运行在 90 分钟限时内 19 项检查全部通过。
方法核心:该任务要求二进制逆向 + 热补丁,19 项检查全有或全无。关键差异在于 agent 不直接解题,而是先为任务构建一个小型服务并冻结,之后通过这个服务解题,避免每过几轮就重新推导约束。
动机:长运行中 agent 对自身状态的认知会逐渐偏离实际位置。作者在运行自己的多智能体系统时总结出这套漂移理论,并因系统内一个 agent 自发用该理论诊断自身漂移而将其固化为方法。
作者的态度:欢迎他人复现——可用自己的技术栈跑(更能说明问题),也可用作者的免费步骤;作者自己尝试 4 次才通过一次,且没有「只给构建阶段、不给方法文本」的对照运行,因此「任意构建阶段都有效」这一替代解释尚无法排除。
「编程与Agent」频道最新
- Vercel 开源原生 AI 编程 Agent fx:10µs 冷启动 — Rasmic · 2026-08-19
- Grok 开源版文件上传服务 Byteship 发布 — jasonkneen · 2026-08-19
- ClawGym II 论文:混合跨工具训练 Agent — omarsar0 · 2026-08-19
- MacStories 发布 Codex 自动化指南:处理笔记、邮件与稍后读 — Dimillian · 2026-08-19
- 研究揭示上下文压缩致 Agent 调用增加三倍 — dair_ai · 2026-08-19
- Council of High Intelligence:多AI视角辩论辅助决策 — tom_doerr · 2026-08-19