专题 · FULL STORY

Magic 宣称 1/50 算力复现 DeepSeek V4 Pro

初创公司 Magic 于 9 月 9 日发布预训练效率研究更新,宣称新配方以约 1/50 的 FLOPs 匹配 DeepSeek V4 Pro 预训练效果,随后公布后续路线:以长上下文 RL 教会 agent 测试时学习,完成对齐后再发布模型,并自称最小的万亿参数模型团队。

2026-09-09 ~ 2026-09-09 · 2 集 · 13 条

第 1 集 · Magic 宣称 1/50 算力匹敌 DeepSeek V4 Pro 预训练(2026-09-09,11 条)

9 月 9 日,AI 初创公司 Magic 发布预训练效率研究更新,宣称通过算法效率大幅缩小与小巨头的算力差距:新配方以约 1/50 的 FLOPs 匹配 DeepSeek V4 Pro Base 的预训练效果,折算约 50 万美元的 GB200 算力(约等于 GPT-3 预训练算力的一半)。团队自述没有 10 万张芯片,唯一出路是算法效率,直接挑战「前沿预训练是大厂专属游戏」的共识。目前所有数据均为 Magic 单方面宣称,尚无第三方复现或独立评测。

已确认

  • 核心宣称:约 1/50 的 FLOPs、约 50 万美元 GB200 算力即可匹配 DeepSeek V4 Pro Base 的预训练效果;据 DrSingularity 转述,该配方比领先开源权重模型的训练方法计算效率高 10 倍以上,后续目标指向万亿参数规模与自动化 AI 研发。
  • 成本与规模口径:按 DeepSeek V4 Pro 配方达到同等能力需花费超过 1 亿美元;Magic 称以约 400 万美元(10 倍规模)的训练成本超越了所有公开可用的基座模型。
  • 方法论细节(官方跟进帖披露):预训练配方是横跨模型架构、优化器、训练目标与数据等数十项改动相乘的结果,而非单项突破;团队还体会到「修复小 bug」本身也是算力乘数。
  • 评测与数据取舍:Magic 称其目标是打造最强的 SWE(软件工程)与自主 AI 研发模型;为平衡数据取舍,除标准 out-of-sample 评估套件外,还关注「知识评测」(knowledge evals),且为每一代模型重新做知识评测,以防止过拟合评测集。

为什么重要

  • 若宣称成立,意味着小团队可凭算法效率而非巨额算力参与前沿基座模型竞争,显著拉低预训练门槛。
  • 「数十项改动的乘性叠加」与「修 bug 也是算力乘数」的表述,将工程细节提升到与算力同等的战略地位,对资源受限的研究团队具有方法论参考价值。
  • 每代模型重做知识评测防止过拟合的做法,为评测可信度提供了可借鉴的实践样本。
  • 目前所有数据均为 Magic 单方面宣称,尚未见第三方复现或独立评测验证,读者宜以官方博客后续披露为准。

第 2 集 · Magic 披露下一步路线并自称最小万亿参数模型团队(2026-09-09,2 条)

在预训练研究更新后,Magic 公布后续计划:用长上下文扩展 RL 以教会 agent 测试时学习;通过「模型对自身意图的潜在知识」进行对齐,之后再发布模型。团队同时发推称自己「可能是全球训练万亿参数模型的最小团队」,强调单个有判断力的人如今能产生前所未有的价值,并借此开放招聘,列出了三个技术方向。