MagicaLabs 称花 400 万美元预训练即超公开基座模型,效率比 DeepSeek 高 50 倍
magicailabs · x · 2026-09-09
MagicaLabs 宣称其新预训练食谱以约 400 万美元(10 倍规模)的训练成本,超越了所有公开可用的基座模型;按 DeepSeek V4 Pro 的配方达到同等能力需花费超过 1 亿美元。
关键信息:
- 核心路线是算法效率而非堆芯片:新配方用约 1/50 的算力匹配 DeepSeek V4 Pro 的预训练效果,约合 GPT-3 一半的 FLOPs,或在 GB200 上约 50 万美元。
- 食谱是模型架构、优化器、训练目标与数据数十项改动的乘性叠加结果;团队还发现修复小 bug 本身就是算力乘数。
- 为验证 post-RL 表现,团队从基座跑了一轮短数学 RL,并表示不会止步于当前规模。
- 该说法出自实验室自述,尚无第三方复现。
所属事件:Magic宣称预训练效率提升50倍 50万美元追平DeepSeek(6 条相关)→
「Infra」频道最新
- 半导体市场为何总只剩三家:盈亏平衡规模的 toy model 解释 — BenBajarin · 2026-09-09
- Deft Robotics 推出物理 AI 统一部署平台,补齐真实世界落地短板 — Scobleizer · 2026-09-09
- 一年半攒下 RTX Pro 6000、双 DGX Spark:本地 AI 算力真实体验 — EAccelerate_42 · 2026-09-09
- Perplexity CEO:推理已大规模迁至 NVLink Blackwell,下一代将上 Vera Rubin — AravSrinivas · 2026-09-09
- 台积电 2030 启用 High-NA EUV,三星 2028 目标 DRAM 应用 — BenBajarin · 2026-09-09
- 分析师称企业云 AI 开销或达本地部署方案的 10-20 倍 — DavidLinthicum · 2026-09-09