「训练极深模型的工艺在 LLM 时代失传了」:圈内怀念深度堆叠手艺

_arohan_ · x · 2026-09-04

xidulu 发推指出:大家都在谈论用 looping(循环推理)换取更多深度,但训练一个「真正极深」模型的工艺(craftsmanship)在 LLM 时代似乎正在失传——如今主流做法是靠推理时的重复迭代而非架构上的深度设计。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →