传 Fable 实为 2-2.5T 参数而非 10T,Kimi K3 用 2.8T 追平其水准
jietang · x · 2026-09-10
针对 O'Neill 关于前沿模型规模的推测(Fable 约 2-2.5T 参数而非 10T;Kimi K3 为 2.8T 参数、用约 2-3 万张 Blackwell 等效算力训练,能力已接近 Fable 5),jietang 回应称:找到最优模型规模确实棘手——数据量、活跃参数数、环境数量与目标推理成本都要权衡,模型性能还受诸多其他因素影响,每个因素都引入自身的不确定性。
讨论的核心论点:Anthropic 算力远多于月之暗面、RL 环境与架构优化器更好,若 Fable 仅略胜 K3,那它几乎肯定是更小的模型;GPT-5.5/5.6 则更小。注意以上规模均为未经证实的推测。
「模型」频道最新
- 348M 小模型刷爆 GPT-3 算术:9 项测试平均 99.4% — nkthebass · 2026-09-10
- naval 点破前沿实验室飞轮:靠最聪明用户蒸馏数据 — naval · 2026-09-10
- Kimi K3 在 Harvey 法律硬任务上比 Fable 5.1 高出 60% — togethercompute · 2026-09-10
- OpenAI 内部模型 88 小时解出 Navier–Stokes,动用约 1 万个协作 Agent — TheMoonMidas · 2026-09-10
- 风评称 v4.1flash 正式版略强于此前的测试版 — teortaxesTex · 2026-09-10
- Cisco 安全模型 Foundation-Sec-8B 下载量突破 70 万 — aminkarbasi · 2026-09-10