递归可省算力:10T 递归模型或匹敌 13-17T 稠密模型
scaling01 · x · 2026-09-02
scaling01 在一条讨论线程中给出对模型规模与计算深度的非正式估算:
- 引入一次递归后,一个 10T 参数的递归模型可达到典型 13-17T 稠密模型的水平;5.9-7.7T 的递归模型可匹敌 10T 模型。
- 其依据是深度换参数的账:以 Kimi-K3 约 2.8T 参数、93 层为参照,若要达到约 240 层(约 2 倍 GPT-4)的深度,需将深度放大 2.58 倍,而参数随深度立方增长,即需约 17 倍参数。
- 据此推断传闻中的 Astra 将具备相当于 40-50T 参数模型的计算深度。
- 在回复质疑时作者补充:递归并不能简单等效于更大模型——你得不到更大模型额外的表达能力和参数量。
作者未给出严格论证或出处,属个人推算性质的观点,但数字具体,反映了圈内对「深度 vs 参数」换算的讨论方式。
「模型」频道最新
- 用户实测 GPT 5.6 Sol medium:能力损失不大且更快 — iamsahaj_xyz · 2026-09-02
- 自建 ML 基准测 Fable 5.1:能力升级且拒绝率降至 0/12 — xeophon · 2026-09-02
- Fable 5.1 号称省 45%,重度用户反称额度一小时烧光 — heypearlai · 2026-09-02
- Fable 5.1 发布不到24小时,玩家已用单条prompt复刻马里奥赛车 — eyishazyer · 2026-09-02
- Astra 安全数据反直觉:能力更强,违规攻击行为却降为零 — VoidStateKate · 2026-09-02
- 训练中知识蒸馏偏科:推理提升,事实记忆反受损 — roydanroy · 2026-09-02