「训练极深模型的工艺在 LLM 时代失传了」:圈内怀念深度堆叠手艺
_arohan_ · x · 2026-09-04
xidulu 发推指出:大家都在谈论用 looping(循环推理)换取更多深度,但训练一个「真正极深」模型的工艺(craftsmanship)在 LLM 时代似乎正在失传——如今主流做法是靠推理时的重复迭代而非架构上的深度设计。
「漫话AGI」频道最新
- 数据:AlphaGo 之后职业棋手决策质量与新招速率双双跃升 — burny_tech · 2026-09-04
- 研究者:CoT 可读性不足以作为长期 AI 安全的兜底 — tszzl · 2026-09-04
- VC 投资人谈 AGI 前景集体失语,多数人回避根本性判断 — km · 2026-09-04
- 从人工神经网络到「人工心理学」:研究者感慨 AI 发展路线反转 — round · 2026-09-04
- AI 时代就业市场 K 型分化:持续学习者拿七位数 offer — round · 2026-09-04
- “心灵不物理”论遭反杀:Minecraft 也不是物理实体,但它真实存在 — NathanpmYoung · 2026-09-04