14 天长任务对比:人类越做越强超线性扩展,Agent 陷入对数曲线
AlexGDimakis · x · 2026-09-16
Dimakis 团队发布论文,在 AtCoder 启发式竞赛任务上对比人类专家程序员与编码 Agent 的表现,并提出 Elo-per-token 分析法刻画性能曲线。
关键发现:
- Agent 初期扩展速度比重复采样快,但长时程上收敛到理论的对数线性扩展曲线;人类则呈现超线性提升——因为人类在解题过程中会持续学习(对问题本身了解越来越多),而 Agent 是无记忆地随机尝试。
- 该结果在不同 harness 和任务上均稳定复现。
实用的算力分配规则:如果预算 500 万 token,应开 1 个 Claude Code 会话;3000 万 token 时应拆成 2 个各 1500 万的独立会话取最优;1 亿 token 预算则应开 3 个独立会话。按扩展拐点原则性拆分长任务,能比单次长跑获得显著增益。
「编程与Agent」频道最新
- Muse 用子智能体并行读书,一本书一条提示词变章节播客网站 — armand_ruiz · 2026-09-16
- Image-to-WebDev 榜更新:GPT-6 Astra 居首,GLM-5.3-Flash 性价比惊艳 — arena · 2026-09-16
- 输出概率而非文本的新模型:比 Fable 级模型快 25 倍、便宜 600 倍 — danshipper · 2026-09-16
- 两年用 ChatGPT 当职业教练,如今 agent 比我更懂我的工作 — danshipper · 2026-09-16
- 晒图对比:Periodic Harness 与原版 Claude Code 效果差距惊人 — zainhas · 2026-09-16
- 让编码 Agent 在 tmux 里干活并投到浏览器 IDE,直观可见 — lucasmeijer · 2026-09-16