MIT 演讲:不讲 Transformer,从第一性原理看 LLM 为何有效
vishalmisra · x · 2026-09-27
Vishal Misra 发布了他在 MIT 演讲的视频,从第一性原理视角解释 LLM 的工作机制,全程不涉及 attention 或 Transformer 结构。
核心论点是:SFT、RLHF、RL 等训练方法本质上都是在重塑概率分布,而剥开这些外壳,LLM 的底层仍然是基于分布的下一个 token 预测。理解了这一点,就能理解模型能力的来源与边界。
所属事件:MIT 演讲从第一性原理拆解 LLM 与 Agent 机制(2 条相关)→
「研究」频道最新
- Linzen 晒两篇论文反驳 Bender:工具调用让「大模型无语义」论失效 — tallinzen · 2026-09-27
- 模型路由评测缺位遭群嘲,Elvis Saravia 呼吁做真正的好基准 — omarsar0 · 2026-09-27
- DeepMind 研究员批评论文作者无视实证证据,拒绝根据新证据修正立场 — AndrewLampinen · 2026-09-27
- 谷歌研究员 Lampinen 长文反驳「随机鹦鹉」:纯语言训练也能学到意义 — AndrewLampinen · 2026-09-27
- 小米发布 MiMo-V2.6 论文:用强化学习规模化冲击 LLM 核心 — KyeGomezB · 2026-09-27
- 大脑是预测机器:失去现实纠偏信号就会开始幻觉 — alfcnz · 2026-09-27