异步超大规模训练的信用分配被视为自改进的关键突破口
teortaxesTex · x · 2026-10-07
- 引用的观点:当前神经网络完全同步,在超大集群上有严重的 straggler 问题——等待最慢的 GPU 完成会拖垮 MFU。
- teortaxesTex 认为超大规模异步训练中「有原则的信用分配」是 RSI(自我改进)路上一个基础但具有 foom 性质的突破点,需要比「加了拐杖的 backprop」更强的机制。
「Infra」频道最新
- Google 开源 EmbeddingGemma 2:740M 参数多模态嵌入模型,全本地语义搜索 — lmoroney · 2026-10-07
- 马斯克放话:Terafab 芯片厂将完全自建自营,TSMC 至多转租一部分 — MickeySteamboat · 2026-10-07
- 用 3.8% 的 GPU 跑出 72% 的智能?Mistral 计算效率引热议 — cyb3rops · 2026-10-07
- 捷克央行行长亲自安装 8 块 GPU,AI 圈人士劝「多买点」 — misovalko · 2026-10-07
- Hugging Face Kernels 中心上线:像找模型一样即插即用计算 kernel — ariG23498 · 2026-10-07
- Intel CEO 澄清:将继续留在 Musk 的 Terafab 芯片制造项目 — rohanpaul_ai · 2026-10-07