蒸馏为何比普通监督学习更有效:关键在传递完整概率分布
khademinori · x · 2026-09-29
作者分享一个关于知识蒸馏的知识点:蒸馏之所以比普通监督学习(单标签 one-hot)更有效,是因为教师模型传递给学生的不是单个类别标签,而是完整的概率分布向量 p(),即「暗知识」——类别之间的相似度信息也被一并传递,监督信号更丰富。
「研究」频道最新
- 眼睛约 100Hz 的眼球微震颤,或为视觉皮层实现超分辨率 — docmilanfar · 2026-09-29
- AI 从零设计病毒:斯坦福等合成 302 个噬菌体基因组,16 个有效 — CallRevolutionary894 · 2026-09-29
- Reddit 讨论:Softmax 输出仅 N-1 自由度,能否少一层参数? — Kinexity · 2026-09-29
- EAPO:熵引导 credit assignment,让 LLM 推理强化学习更会探索 — coallaoh · 2026-09-29
- 让扩散模型故意塌缩:从预训练权重中提取人群图谱 — kwangmoo_yi · 2026-09-29
- Duplex-MPE 基准测 AI 何时该开口:MiniCPM-o 4.5 三项领先 — PKU · 2026-09-29