深度解析 GPT-6 递归深度传闻:MoE 加递归或成推理新范式

panic_in_the_galaxy · reddit · 2026-09-24

关于 GPT-6 最有趣的传闻是它采用递归深度(recurrent depth)架构:部分 Transformer 层可被复用多次,让有效深度与独特参数量解耦——增加计算不必增加全新权重。

与 MoE 的组合

潜在影响

注意:GPT-6 官方架构未公布,递归深度仅是报道传闻,逐 token 自适应深度属作者对现有研究(Geiping et al. 2025 递归深度潜在推理、Bae et al. 2025 Mixture-of-Recursions)的外推。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →