损失约定隐藏调参:BCE 从求平均改求和,准确率反降 7 个点

BlackHC · x · 2026-09-16

作者在持续学习实验里发现一个隐蔽 gotcha:从只对当前两个输出的 BCE 损失换成该方案后,最终十类准确率从 19.4% 升到 58.1%(旧输出权重虽无直接更新,但共享网络的隐层在变,预测会随之漂移)。

更关键的坑:mean BCE 会对一对的两个输出取平均;若改成求和(loss×2),准确率反而从 58.1% 降到 51.2%。原因是在固定 SGD 学习率下,求和等于把更新步长翻倍——「取平均的约定一直在替我们做一部分调参」。结论:把 loss scaling 当作优化器设置的一部分显式对待。

所属事件:BlackHC 持续学习玩具实验:PCA 回放达 91.1%(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →