14 天长任务对比:人类越做越强超线性扩展,Agent 陷入对数曲线

AlexGDimakis · x · 2026-09-16

Dimakis 团队发布论文,在 AtCoder 启发式竞赛任务上对比人类专家程序员与编码 Agent 的表现,并提出 Elo-per-token 分析法刻画性能曲线。

关键发现:

实用的算力分配规则:如果预算 500 万 token,应开 1 个 Claude Code 会话;3000 万 token 时应拆成 2 个各 1500 万的独立会话取最优;1 亿 token 预算则应开 3 个独立会话。按扩展拐点原则性拆分长任务,能比单次长跑获得显著增益。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →