循环深度 3 倍增益,相当于参数扩 81 倍的架构讨论

xuanalogue · x · 2026-09-04

Ryan Greenblatt 认为 OpenAI 某模型推理能力的提升主要来自架构变化而非纯参数扩展。他注意到 Jakub 的说法是「参数量在 GPT-4 的 2 倍以内」而非相对其他基准的 2 倍,据此推算深度增加约 3 倍——而按开源模型的一般扩展趋势,仅靠常规参数扩展要达到 3 倍深度需要参数增长约 81 倍,因此循环深度(recurrent depth)的大幅增加很可能是能力跃升的关键。

@xuanalogue 则对该数学关系提出疑问:默认假设深度增加 3 倍约等于参数增加 3 倍,而 looped transformer 因参数复用、缺乏权重特化,等价增益还更低,除非深度增加同时解锁了其他方向的扩展,否则 81 倍的换算难以成立。

所属事件:Greenblatt称新模型深度三倍跃升源于架构而非参数堆叠(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →