MIT 演讲从第一性原理解读 LLM,全程不谈 Transformer

Vishal Misra 在 MIT 演讲中从第一性原理视角解释 LLM 的工作机制,全程不涉及 attention 或 Transformer 结构。其核心论点是:SFT、RLHF、RL 等方法只是在重塑分布,LLM 的本质仍是下一词预测。他还补充了对 Agent 的看法:Agent 与普通 LLM 用法的关键区别不在模型本身,而在于围绕模型搭建的工程系统——工具、记忆、权限、反馈循环和反复调用等「周围的机器」。

2026-09-27 ~ 2026-09-27 · 3 条相关

另有 1 条近重复转述:soumitrashukla9