MIT 演讲:剥开注意力机制,LLM 本质仍是下一词预测
soumitrashukla9 · x · 2026-09-27
Vishal Misra 在 MIT 的演讲视频提出对 LLM 的第一性原理解读,全程不谈 attention/transformer:SFT、RLHF、RL 只是在重塑分布,但底层逻辑始终是「从某个分布预测下一个 token」。
转发者 Abhishek N 评论:说「只是预测下一个 token」的人并没有错,只是他们低估了这个框架本身有多强大。
所属事件:MIT 演讲从第一性原理解读 LLM,全程不谈 Transformer(3 条相关)→
「研究」频道最新
- NBER 论文:认知技能生产率提升解释美国职业内工资分化 — soumitrashukla9 · 2026-09-27
- 新 RL 技巧用偏差换方差,小批量训练更稳不再崩 — willcb · 2026-09-27
- Quail 项目谈用 agent 写码:更要站在社区基建上 — charles_irl · 2026-09-27
- 1700万参数小模型微调后八成场景胜过通用大模型 — max_paperclips · 2026-09-27
- Scaling 假说为何永远无法被证伪?一条 Duhem-Quine 视角的长文 — burny_tech · 2026-09-27
- Linzen 晒两篇论文反驳 Bender:工具调用让「大模型无语义」论失效 — tallinzen · 2026-09-27