深度解析 GPT-6 递归深度传闻:MoE 加递归或成推理新范式
panic_in_the_galaxy · reddit · 2026-09-24
关于 GPT-6 最有趣的传闻是它采用递归深度(recurrent depth)架构:部分 Transformer 层可被复用多次,让有效深度与独特参数量解耦——增加计算不必增加全新权重。
与 MoE 的组合
- MoE 提供广度与专家特化,递归提供深度,形成两个独立扩展维度:「做什么计算→选专家」「做多少计算→选递归层数」
- 不同递归 pass 可路由到不同专家,重复经过模型并不只是重复同样的事
- 近期 looped-MoE 研究显示,在参数、FLOPs、KV-cache 预算对齐的情况下,此类模型可超越标准 Transformer,说明优势并非暗中多花算力
潜在影响
- 简单 token(如「the」)只需 1 次 pass,难推理可多次——若配合逐 token 自适应深度,测试时计算将由网络内部分配,而非主要靠生成上千个 CoT token
- Huginn 等递归深度模型已证明可通过多跑递归块提升测试时算力
注意:GPT-6 官方架构未公布,递归深度仅是报道传闻,逐 token 自适应深度属作者对现有研究(Geiping et al. 2025 递归深度潜在推理、Bae et al. 2025 Mixture-of-Recursions)的外推。
「模型」频道最新
- CAIS 发布 HLE-Diamond:1000 题精修基准,GPT-6 Astra 拿 60.6% 居首 — steipete · 2026-09-24
- 10 个月从 28% 到 80%:宜家组装测试暴露多模态跃进 — emollick · 2026-09-24
- Anthropic 工程师回应「Opus 5.5 早期体验」:超出预期 — felixrieseberg · 2026-09-24
- 首发用户实测 MiMo v2.6 Pro:时而极强时而彻底翻车 — mariofilhoml · 2026-09-24
- Meta 在 FB/Instagram/TikTok 强推 Muse,分析师点破分发即胜负手 — BenBajarin · 2026-09-24
- Hugging Face 趋势榜首竟是文本分类模型 — vanstriendaniel · 2026-09-24