3.8万小时证明环境学习服从对数Sigmoid,学速三月翻倍

EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments

Deyao Zhu, Xin Zhou, Shengling Qin, Xuekai Zhu, Hangliang Ding, Shu Zhong, Zixin Wen, Zhonglin Xie, Chenhui Gou, Linxuan Ren, Yueyang Wang, Junfeng Zhong, Rui Liu, Tian Gao, Yangguang Lin, Jingyuan Zhang, Maojia Song, Xuan Qi, Jinhong Wu, Chenyang Zhang, Yinzhu Piao, Ziru Niu, Hongbin Lin, Lingxiang Meng, Peng Tang, Chengyao Tang, Shanyu Wu, Huanyu Zheng, Yu Liu, Liya Zhu, He Wang, Ming Ding, Ziyu Wan, Hao Liu, Sibo Wang, Haotian Zhu, Xintian Zhang, Nan Chai, Yipeng Liu, Panhao Lai, Sihang Yuan, Zixin Su, Ge Zhang, Wangchunshu Zhou, Yantao Du, Wenhao Huang, Guang Shi

cs.CL, cs.LG

2026-07-06

ByteDance Seed 在 134 项至少 12 小时的真实任务上累计约 3.8 万小时交互,平均表现服从 R²=0.998 的对数 Sigmoid;12 小时 Opus 4.8 得 51.3 分,学速从 GPT-5-Codex 到 GPT-5.5 约 221 天涨 8 倍。

这篇在解决什么

预训练缩放律已经把「堆数据、堆算力,损失怎么掉」画成可预测的曲线。Agent 部署之后还要在真实环境里试错、读反馈、改方案,这条曲线有没有同样干净的形状,此前几乎没人量过。

卡点很具体。多数评测只给终态:答对没有、补丁过不过、交付物好不好。MLE-bench、Agents' Last Exam 已经允许迭代,但窗口往往只有几十分钟到一两小时,人还没学出策略就结束了。要量「会不会从环境里学」,需要又长、又有多层反馈、又够难、且现有模型打不穿的任务。

方法

ByteDance Seed 做了 EdgeBench:134 项可执行任务,科学与机器学习 39、系统与软件工程 36、组合优化 19、专业知识工作 19、形式化数学 13、交互游戏 8。每项至少连续跑 12 小时;记录的人类专家工时平均 57.2 小时,最长 320 小时。主难度在视觉或 GUI 操作的任务被排除,以免把感知能力和学习能力搅在一起。

反馈做成双环。内环是工作容器里的本地测试、仿真器、校验器,Agent 可以高频试。外环把隐藏用例和私有评分放在独立 judge 容器里,只有提交才返回校准分数或诊断。宿主还会按固定间隔偷偷打分,用来画学习曲线,但不把这次分数给 Agent 看。

他们把跨任务平均的「迄今最优」分数拟合为三参数对数 Sigmoid:S(t) = Smax / (1 + (tmid / t)^β)。tmid 是达到天花板一半所需的交互时间,β 控制在对数时间轴上爬升有多陡。配套理论把单项任务看成潜在分数图上的前沿扩张:已解锁的分数质量提供可复用能力,未解锁的质量是剩余机会,平均切边近似两者之积,时间坐标因自相似搜索体积取对数,解出来就是这条曲线。单任务可以又平台又跳变,平滑来自 134 项平均。

评测了五个前沿模型:Claude Opus 4.8、GPT-5.5、GPT-5.4、GLM-5.1、DeepSeek-V4-Pro(preview)。每个任务–模型三独立 12 小时试验。GPT 走 Codex(256k compact),GLM 与 DeepSeek 走 Claude Code(200k),Opus 主用 1M。总交互大约 3.8 万小时。公开了 51 项任务和完整评测框架。

结果

134 项平均上,五条 12 小时曲线全部贴住对数 Sigmoid,R² 均不低于 0.997,均值 0.998。同一函数形在六个任务家族里都成立;28 小时(80 项、四模型)和 72 小时(18 项、两模型)窗口里 R² 仍不低于 0.993。只用前 6.5 小时拟合去预测后半段,五模型 R² 均不低于 0.997,RMSE 低于 1.0 分。和常见 S 形比,对数 Sigmoid 的全窗口 RMSE 是 0.390 分;对数 probit、Gompertz、Weibull 在 0.398–0.404,对数线性则差到 0.717。

12 小时排行:

模型2 小时12 小时
Claude Opus 4.839.051.3
GPT-5.536.848.4
GPT-5.429.739.3
GLM-5.126.037.4
DeepSeek-V4-Pro23.331.0

家族上 Opus 全项领先,代码类最高(Opus 67.4,GPT-5.5 65.0),数学类落差最大(Opus 55.0,DeepSeek 14.1)。提交次数不等于学得更好:GPT-5.5 提交最多(3.42 万次),有效提交率最高的是 GPT-5.4(22.2%),Opus 提交更少却拿到最高分。

学习速度用 18 项切片量,这组任务上各模型首次尝试分数接近(6.87±0.97)。从 2025 年 9 月的 GPT-5-Codex 到 2026 年 4 月的 GPT-5.5,两小时增益大约涨了 8 倍,跨度 221 天,前沿 top-2 的对数线性拟合对应约每三个月翻倍。

经验本身值钱。Opus 在 17 项上把 12 小时一次性跑完(保留工作区和反馈)得 43.0;同样预算拆成 6 次独立 2 小时、中间清状态,只取最好,得 36.1,差 6.9 分。42 项上把 Opus 上下文从 200k 扩到 1M,12 小时从 48.0 到 52.5(+4.4),2 小时差距就是 +5.8,后面几乎平行。引力波重建个案里,GPT-5.5 提交 224 次,只有 27 次把最优分抬高至少 0.1 个百分点,总分从 42.8 走到 67.0。

为什么重要

这是第一次用万小时级、跨领域的真实交互,把部署后的环境学习画成一条可拟合、可外推的缩放对象。如果对数 Sigmoid 站得住,早期轨迹可以预报后期分数,模型对比也可以看 tmid 和 β,而不只看某一个截止时刻的终点分。

落地含义很直接。连续带着状态跑,比同等时间的独立重开更强;工作区文件和 compaction 已经能外置记忆,加长上下文窗口仍然稳稳多几分;狂提交救不了样本效率,有效改进的比例和改动是否可复用更关键。

它仍然是群体规律。单任务曲线又平台又跳变,拟合误差随平均的任务数单调下降。拿来排行可以,拿来指导某一个仓库里的某一个 Agent 怎么学,还早。

局限与存疑

论文自己划了适用范围:任务图有强瓶颈、任务中点太散、各家族前沿速度差太大、图结构不是近似无标度、或者更长时间会改变「实际够得着的分数集合」,对数 Sigmoid 都可以坏掉。拟合出来的 Smax 是窗口内的有效天花板,不是永远上不去的硬顶。

另外几处论文没强调、读下来却站不太稳。对数 Sigmoid 比其他 S 形只好一点点(0.390 对 0.398),函数识别主要靠机制叙事,不是靠拟合碾压。学习速度「三月翻倍」建立在 18 项匹配切片和很短的模型世代窗口上,不是全量 134 项。每个设置只有三次种子;长程评测把 API 稳定性算进分数里,GPT-5.4 后半段服务还掉过。五模型还用了两套 harness 和不同上下文长度。134 项里只公开 51 项,完整缩放律目前无法独立复核。经验消融是 17 项、上下文消融是 42 项,不要直接当成全基准结论。

术语

原文与代码

社区讨论

相关论文

全部论文解读