Q Labs 研究:LLM 深度严重受限,128 层仍在持续改进
rickasaurus · x · 2026-09-24
Q Labs Research 发布报告《Computational depth is all you need》,指出自 GPT-3 以来六年前沿模型的层数一直停在 100 层左右,深度早已停止扩展。
- 在仅 1B token 的训练下,loss 在 128 层内持续下降,远超标准深度且未见饱和
- 复现了 contrastive RL 结果,能力提升一直延续到 256 层,报告称 contrastive RL agent 到 1024 层仍获得新能力
- 增加计算深度带来算力效率收益:10^20 FLOPs 下约 1.6 倍,预计 10^26 下可达 3.1 倍
作者认为当前架构并非为超大计算深度设计,这限制了模型表达能力,应像当年 Transformer 取代 LSTM 释放长上下文那样,把计算深度扩展几个数量级。
所属事件:Q Labs:计算深度是缺失的 scaling 轴,LLM 深度停滞百层(4 条相关)→
「模型」频道最新
- 爆料称 OpenAI 今日将密集发布多款产品,新 Agent 备受期待 — iruletheworldmo · 2026-09-24
- MiniMax M3.1 疑以「穴居人模式」思考,CoT 省 token — crusaderky · 2026-09-24
- GPT-6 系列丢掉了 GPT-5.6 死磕任务到完成的特性 — jdjohnson · 2026-09-24
- philschmid 提及 Gemini 3.8 Flash,建议多模态理解任务就用 Gemini — _philschmid · 2026-09-24
- FLock THIS/THAT 1.2 单次前向决策模型发布,跑分超 Opus 与 GPT — matlabulous · 2026-09-24
- 用户抱怨 Claude 过度过滤:合法虚构内容也拒绝,比 ChatGPT 严苛得多 — Dogbold · 2026-09-24