MIT 演讲:剥开注意力机制,LLM 本质仍是下一词预测

soumitrashukla9 · x · 2026-09-27

Vishal Misra 在 MIT 的演讲视频提出对 LLM 的第一性原理解读,全程不谈 attention/transformer:SFT、RLHF、RL 只是在重塑分布,但底层逻辑始终是「从某个分布预测下一个 token」。

转发者 Abhishek N 评论:说「只是预测下一个 token」的人并没有错,只是他们低估了这个框架本身有多强大。

所属事件:MIT 演讲从第一性原理解读 LLM,全程不谈 Transformer(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →