网友推算 2T 参数训练对应 V4.1 Pro:模型扩展仍像炼金,稀疏化拖累算力效率
teortaxesTex · x · 2026-09-21
AI 圈人士 teortaxesTex 对传闻中 2T 参数训练规模的模型进行推算:
- 2T 训练规模大概率对应 V4.1 Pro;若逻辑与 V4.1 类似,还伴随约 540GB 的 engram(记忆)开销,但他质疑 engram 记忆是否会饱和、超过某规模后是否导致脆弱性。
- 预期性能约在 Fable 5 水平。
- 他感慨模型扩展仍然「太像炼金术」:250B 激活参数就是 250B 激活,Meta 两年前就在 16K 张 H100 上跑过 405B 激活,稀疏化只带来一些 MFU 损失,但现实中盲目冲这个规模仍可能浪费数月算力。(含推测成分,未证实)
「Infra」频道最新
- 让 AI 实习生优化任务启动时间,中位数提速约 60% — DanielLockyer · 2026-09-21
- Tim Dettmers 实验室开源周:2 框架 4 篇论文构建本地前沿 AI 生态 — Tim_Dettmers · 2026-09-21
- 实测翻案:这台设备真能跑 LLM 还能做开发 — gnukeith · 2026-09-21
- 拿下 CoreWeave 大单,Backblaze CEO:AI 存储是场圈地运动 — TiernanRayTech · 2026-09-21
- 训练老手支招:checkpoint 存 K8s PVC,但千万别给它设告警 — cto_junior · 2026-09-21
- Baseten CEO:Agent 疯狂烧 token,推理将成为每家公司的核心 IP — baseten · 2026-09-21