Agent 动态调节推理强度,DeepSWE 与 Terminal-Bench 4.0 登顶性价比前沿
_jzhao · x · 2026-09-30
jzhao 团队撰文介绍其 Agent 的两项更新:一是让 Agent 动态选择自身推理 effort,在简单任务上少花算力、难任务上加大投入;二是改进了向子 agent(subagents)分派工作的交接能力。
作者称这些改动使其在 DeepSWE 和 Terminal-Bench 4.0 上处于成本-性能曲线的前沿位置。作者随后补充观点:这是「苦涩的教训」再次应验——应当押注模型本身变得更聪明,工程侧要做的是保证 harness(脚手架)不拖后腿。
「编程与Agent」频道最新
- 开发者演示让 agent 接入 1930 年代至今宏观数据,24/7 盯经济 — virattt · 2026-09-30
- 用 Opus 5.5 做游戏?先学会 Pinterestmaxxing 攒美学素材 — nptacek · 2026-09-30
- Conductor 接入 Sign in with ChatGPT,Codex 订阅一键登录 — charlieholtz · 2026-09-30
- OpenAI 预告 Decisions API:用 gpt-6-luna 快速做图文决策 — stevenheidel · 2026-09-30
- 开发者开始构建专为 ChatGPT 内使用设计的 Codex 原生应用 — danshipper · 2026-09-30
- 用户实测 dots Agent:自动理清订阅每年省约 500 美元 — Yuchenj_UW · 2026-09-30