传 Fable 实为 2-2.5T 参数而非 10T,Kimi K3 用 2.8T 追平其水准

jietang · x · 2026-09-10

针对 O'Neill 关于前沿模型规模的推测(Fable 约 2-2.5T 参数而非 10T;Kimi K3 为 2.8T 参数、用约 2-3 万张 Blackwell 等效算力训练,能力已接近 Fable 5),jietang 回应称:找到最优模型规模确实棘手——数据量、活跃参数数、环境数量与目标推理成本都要权衡,模型性能还受诸多其他因素影响,每个因素都引入自身的不确定性。

讨论的核心论点:Anthropic 算力远多于月之暗面、RL 环境与架构优化器更好,若 Fable 仅略胜 K3,那它几乎肯定是更小的模型;GPT-5.5/5.6 则更小。注意以上规模均为未经证实的推测。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →