拆解 DeepSeek 如何以 1/30 价格完成训练
wordgrammer · x · 2026-08-27
作者在引用的推文中表示,他花了一天时间研究 DeepSeek 的论文,总结出了该模型如何以极低成本(据称为1/30价格)完成训练的关键技术要点(具体技术细节在引用的长文中,本帖仅作为上下文入口)。这引发了对算力效率优化和数据中心的讨论。
「Infra」频道最新
- Zai 国内推理集群破 10 万,智谱自研高速互联 — zephyr_z9 · 2026-08-27
- PeriodicLabs 用 Kimi 降低推理成本 50 倍 — LiamFedus · 2026-08-27
- Qwen3 MoE 剪枝实测:180B 级模型压到 65GB 可跑笔记本 — EyalToledano · 2026-08-27
- MCP servers 应更像 API,少预设工作流 — HankYeomans · 2026-08-27
- 剪枝 Q8 专家可获 Q4 模型大小与精度 — EyalToledano · 2026-08-27
- Databricks 接入 xAI Grok 4.6,支持 50 万上下文 — matei_zaharia · 2026-08-27