忘掉模型名,看算子:attention、RoPE、卷积背后的经典数学
techNmak · x · 2026-09-19
作者提出一种理解 AI 的方式:暂时忘掉模型名,只看底层运算。要点:
- Attention 本质是 query 与 key 的点积、缩放、mask、softmax 后对 value 加权求和——不过是普通线性代数与概率。
- RoPE 将坐标按位置成对旋转,旋转的复合性使点积自然依赖相对位置——看似 LLM 专属技巧,其实是几何。
- 卷积 是滑动小核做同一局部运算;PCA 是中心化后用特征分解/SVD 找主方向再降维投影。
- 训练 是梯度下降沿降低目标函数的方向迭代;score-based diffusion 把对数概率密度的梯度纳入动力学。
这些内容通常分属线性代数、优化、概率、几何、数值方法等课程,但在现代 AI 里不断重逢——把它们串起来是理解 AI 的好路径。
「研究」频道最新
- 伯克利等发布 ABC 全开源双臂行为克隆栈,3500 小时数据 — chris_j_paxton · 2026-09-19
- 千万张细胞图训练的 CROWN 力压百倍数据病理大模型 — bravo_abad · 2026-09-19
- 第三方初测云豆等团队PAW方法:除摘要外全面优于Gemma e4b — yuntiandeng · 2026-09-19
- EPFL、牛津学者发起公开信,呼吁前沿模型厂商开放安全研究 — manoelribeiro · 2026-09-19
- Hamel Husain 解释 LLM 评测中的 trace 是什么 — HamelHusain · 2026-09-19
- 学者用 AI 生成插图,讽刺 AI 糟蹋学术同行评审 — sethlazar · 2026-09-19