Magic 官宣预训练配方效率提升逾 10 倍,剑指万亿参数与自动化 AI 研发
Dr_Singularity · x · 2026-09-09
Magic 发布研究博客,详解其计算高效预训练路线:没有 10 万卡,只能靠算法效率。核心内容:
- 新配方比领先开源权重基座模型效率高 10 倍以上;用约 1/50 FLOPs(约等于 GPT-3 预训练算力的一半,约 50 万美元 GB200 算力)匹配 DeepSeek V4 Pro Base
- 继续扩展 10 倍(约 400 万美元)后,在困惑度评测上显著超过所有公开开源基座模型;按其拟合的 scaling law,用 DeepSeek V4 Pro 配方达到同等能力需超过 1 亿美元
- 方法:用 bits-per-byte loss(消除 tokenizer 差异)在 heldout 数据上评测并拟合 scaling law,评测覆盖 DeepSeek、Kimi、NVIDIA 的开源基座;并指出在 vLLM/SGLang 上测开源模型 logprobs 时发现了若干问题
- 战略判断:预训练 + agentic RL + 长上下文足以构建超人编程智能体并自动化 AI 研发;团队已从长上下文入手,本次聚焦预训练,下一步继续 scaling 到万亿参数
所属事件:Magic 宣称预训练效率提升 50 倍,50 万美元匹敌 DeepSeek V4 Pro(9 条相关)→
「Infra」频道最新
- Coval 语音基准:Baseten STT 比 OpenAI 快约 5 倍且错误率最低 — baseten · 2026-09-09
- 2×4090 本地跑 Agent 实测:软上限 5 个@64k,硬上限 9 个 — Iamisseibelial · 2026-09-09
- exe.dev 深度解析:一条 ssh 命令秒开带持久盘的 Linux 沙盒 — davidcrawshaw · 2026-09-09
- GPT-6 Astra 登陆 Amazon Bedrock:百万 token 上下文,首达网络安全 Critical 级 — AWS ML Blog · 2026-09-09
- DeepSeek v4 与 GLM 推理速度跑赢 vLLM 和 SGLang — jedisct1 · 2026-09-09
- Estha 把一台 Mac 变成共享 AI 服务器,同事共用本地模型 — HaktanSuren · 2026-09-09