循环深度 3 倍增益,相当于参数扩 81 倍的架构讨论
xuanalogue · x · 2026-09-04
Ryan Greenblatt 认为 OpenAI 某模型推理能力的提升主要来自架构变化而非纯参数扩展。他注意到 Jakub 的说法是「参数量在 GPT-4 的 2 倍以内」而非相对其他基准的 2 倍,据此推算深度增加约 3 倍——而按开源模型的一般扩展趋势,仅靠常规参数扩展要达到 3 倍深度需要参数增长约 81 倍,因此循环深度(recurrent depth)的大幅增加很可能是能力跃升的关键。
@xuanalogue 则对该数学关系提出疑问:默认假设深度增加 3 倍约等于参数增加 3 倍,而 looped transformer 因参数复用、缺乏权重特化,等价增益还更低,除非深度增加同时解锁了其他方向的扩展,否则 81 倍的换算难以成立。
所属事件:Greenblatt称新模型深度三倍跃升源于架构而非参数堆叠(4 条相关)→
「研究」频道最新
- POSTECH 发布 PACE:用协调智能体挖掘用户请求中的隐性冲突 — POSTECH · 2026-09-04
- 机器必有情绪?Sloman 1981 年论文早已给出计算分析 — yeastsplainer · 2026-09-04
- GPT-6 Astra 能跳过思考仍答对,CoT 特权信号遭质疑 — Dan_Jeffries1 · 2026-09-04
- Sinclair 创企 Life Biosciences 将表观遗传重编程疗法推进临床 — Olivier__OG · 2026-09-04
- 新论文攻 TCR 特异性预测:抗原识别配对与结合边界 — victorgreiff · 2026-09-04
- Terminal-Bench Science 数月内近饱和,科学评测亟需动态环境 — shyamalanadkat · 2026-09-04