共现是 Token 架构的数学基石:梯度下降压缩出的分布
gerardsans · x · 2026-10-04
作者回应关于语言模型工作原理的讨论,指出虽然共现统计不是全部图景,但它是这套架构的必备要素:权重与偏置本质上是梯度下降在语料上压缩出的分布,共现是其赖以成立的数学框架。并拆解了完整链条——嵌入创建(训练形成的 token 配置)、推理动态(分词、位置编码、prefill、逐层注意力与 MLP 到采样)以及自回归循环。
所属事件:讨论热辩:共现统计是 LLM 与 Transformer 的数学基石(3 条相关)→
「研究」频道最新
- arXiv 论文揭示:个人 Agent 记忆越多反而越容易出错 — rohanpaul_ai · 2026-10-05
- 新研究:个人和小微发明者正更积极用 AI 写专利 — robseamans · 2026-10-05
- 《科学报告》论文:大象合唱声学模式可编码社交情境 — abenitezburraco · 2026-10-05
- 多智能体群蜂几乎无用:切块让 1-2B 小模型召回率从 0.3 升至 0.57 — deadatreides1 · 2026-10-05
- Sinclair 哈佛实验室首次公开演示:重编程基因清空培养皿中的癌细胞 — tomchapin · 2026-10-04
- 自训练别只留正确答案:策略多样性采样提升pass@k — PMinervini · 2026-10-04