专题 · FULL STORY

曝字节预训练5-10万亿参数大模型

外媒披露字节跳动正推进5至10万亿参数的超大模型预训练,创始人张一鸣明确反对蒸馏,旨在年底前加速追赶美国头部AI实验室。

2026-08-07 ~ 2026-08-09 · 2 集 · 21 条

第 1 集 · 字节被曝预训练5-10万亿参数大模型,张一鸣反对蒸馏(2026-08-07,19 条)

据《金融时报》等多家媒体报道,字节跳动正在推进参数量高达5万亿至10万亿(5T-10T)的超大模型早期预训练,预计将于今年年底前准备就绪。创始人张一鸣明确反对蒸馏西方模型,要求团队坚持独立自研。若传闻属实,这将是目前中国已知参数量最大的模型,标志着大模型军备竞赛进入新量级。

已确认

  • 据《金融时报》等媒体爆料,字节跳动正在预训练5T至10T参数的超大模型,目前处于早期阶段,预计年底前完成。
  • 字节跳动创始人张一鸣在内部会议上明确表态,坚决反对蒸馏西方模型,要求不走捷径,坚持底层能力独立自研。
  • 该项目由字节Seed团队负责,团队规模在全球已达约2000人。据传由前Google DeepMind员工吴永辉及Seed Foundation负责人项亮等主导。

尚未确认

  • 字节最终确定的模型参数量级究竟是多少,目前传闻在5T到10T之间浮动,最终规模尚未敲定。
  • 该模型的具体技术路线与实际落地服务方式尚未明确。

为什么重要

  • 若传闻属实,这将是目前中国已知参数量最大的模型,规模达Kimi K3(2.8T)的数倍,并直接对标Anthropic传闻中约8T参数的Mythos模型。
  • 针对10T模型的落地可行性,网友@zephyrz9与研究者Alex Suchenzang提出质疑,认为直接在线服务并不现实,推测字节大概率需要采用模型蒸馏等技术,将其压缩为更小、更高效的版本投入实际应用。
  • 业内人士@zijingwu进一步指出,预训练此类巨型模型其实仅需约3万张GPU,真正的算力挑战在于推理成本,因此厂商最终大概率会选择提供蒸馏版模型。
  • 投资人Chamath指出,如果报道属实且完全没有使用蒸馏技术来冷启动,那将证明许多事情是“价值毁灭”而非“价值创造”。

第 2 集 · 曝字节跳动正训练超大模型加速追赶美国头部实验室(2026-08-09,2 条)

据业内人士透露,字节跳动正在训练一款全新的大型 AI 模型,其规模有望逼近 Anthropic 最前沿的系统(原推称 Mythos)。此举表明中国 AI 企业正持续发力,不断缩小与顶尖美国 AI 实验室之间的技术差距。同时,国内多家 AI 实验室也在推进类似规模的大模型训练,整体行业正加速追赶国际前沿水平。