归一化让概率信号失真,用 KL 训练恐致模型崩坏
spikedoanz · x · 2026-09-17
spikedoanz 进一步举例说明为何不能把归一化后的概率分数当训练信号:归一化会把 (0.09, 0.01) 变得与 (0.9, 0.1) 完全相同,丢掉置信度信息。这种情况下模型正确的输出应是「不确定」即 (0.5, 0.5)。若仍对这些各自独立采样的标量做 KL 损失训练,模型大概率会学崩。这是对「归一化只多花几毫秒」提议的反驳。
所属事件:开发者警告归一化概率分数不宜直接作训练信号(2 条相关)→
「研究」频道最新
- CAIS 发布 HLE-Rolling:持续更新的「人类最后考试」替代版 — devindkim · 2026-09-18
- RLE-Bench:机器人自生长身体完成任务,暴露编码Agent物理推理短板 — daibond_alpha · 2026-09-18
- ENCODE GRAMMAR 模型文档改用交互式 HTML README 替代静态 PDF — anshulkundaje · 2026-09-18
- Aspen 世界模型×物理研讨会明年2月办,10月9日截止摘要 — randall_balestr · 2026-09-18
- Cell 专刊:生物医学需要能预测干预结果的世界模型 — rishabh16_ · 2026-09-18
- RLHF 之后又有 RLCD:用强化学习让 LLM 的置信度可校准 — prdeepakbabu · 2026-09-18