20 小时、2 亿 token 的任务让大规模后训练几乎不可行

nrehiew_ · x · 2026-09-03

作者论证长程任务可视为某种分布外评测的代理:当单个任务耗时 20 小时、消耗 2 亿 token 时,对其进行大规模后训练极其困难——需要面对基础设施噩梦与上下文压缩问题。这解释了为何此类任务能较好检验模型的真实泛化能力。

所属事件:FrontierSWE v2 发布:20 小时长程编码基准,Fable 5.1 领先超 24 个百分点(5 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →