研究者仍把 Transformer 当黑盒:公开讨论十年内难有真理解
gerardsans · x · 2026-09-21
作者 Gerardo Sans 指出,当前大多数研究论文仍把 Transformer 当作黑盒对待——即便是受过多年专业训练的研究者,也很少有人愿意打开引擎盖,许多人仍以为 embedding 天然承载语义,或把梯度下降解释成三维曲面。
他进一步回应称:如果不理解预训练如何影响 embedding 空间、MLP 层与感知机的角色,讲 residual stream 并没有多大价值;要在公开讨论层面达到有意义的理解,可能需要数天入门功课,他不认为未来十年会实现,流行叙事会有,但缺乏实质价值。
「漫话AGI」频道最新
- 2026年AI采用最快的医院死亡率最低 — Distinct-Question-16 · 2026-09-21
- binarybits 质疑算力需求无限论:AI 爆炸三大情景仅军事一条可信 — binarybits · 2026-09-21
- 放慢 AI 只会让智能被政府和 3 万亿美元公司垄断 — SucceededMind · 2026-09-21
- 开发者激辩:代码审查自动化后,新手还该不该学编程 — mgill25 · 2026-09-21
- Yacine:程序员将像「计算机(人类)」职业一样被遗忘 — yacineMTB · 2026-09-21
- OpenAI 研究员 Noam Brown:对齐的 AI 员工或让大公司反超初创 — victor_explore · 2026-09-21