模型代际提升 vs 万倍并行算力,双方晒数据激辩谁更划算

scaling01 · x · 2026-09-19

一场关于测试时计算 scaling 的技术争论。反方 @eliebakouch 等主张:图中显示一代模型的升级带来的收益,大于并行拉大 1 万倍算力的收益。

scaling01 反驳:图里横轴只是约 30 倍的算力差异,却被拿来论证"并行扩 1 万倍不如换模型"——30 倍不等于 1 万倍。对方则从图中提取数据点称:内部模型每翻倍算力提升 0.17 logits,而 Astra(更强的串行测试时计算)每翻倍提升 0.18 logits,即串行测试时计算的效率并不低于模型代际差距。双方实质在争论串行 vs 并行测试时计算的边际收益如何测度。

所属事件:Noam Brown:agent 集群对纳维-斯托克斯发现贡献不足一成(11 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →