拆解大模型背后的核心数学基础
udmrzn · x · 2026-07-31
分享了《大语言模型背后的数学》一文,指出 LLM 虽看似神奇,实则建立在一系列核心数学概念之上。文章系统梳理了 Attention 机制中的 Q/K/V、缩放因子、反向传播、梯度下降、交叉熵损失、旋转位置编码以及 RMSNorm 等关键底层原理。
「研究」频道最新
- Transluce发布WeirdChat,收录17万条大模型异常行为 — ChowdhuryNeil · 2026-07-31
- 伯克利峰会探讨:走向自我改进的智能体系统 — furongh · 2026-07-31
- NeurIPS 2026 将在悉尼举办 AI for Science 研讨会 — MarioKrenn6240 · 2026-07-31
- 强化学习的价值:解决可学习但不可教授的问题 — sytelus · 2026-07-31
- AdaMAST:用失败分类法提升AI代理表现 — abeirami · 2026-07-31
- Kimi K3 论文硬核系统工程:自研编译器与芯片设计 — DynamicWebPaige · 2026-07-31