新论文质疑“平坦极小值”:深度学习泛化也许看错了指标

theomitsa · x · 2026-07-28

一篇新论文提出了一个尖锐问题:“平坦极小值”是不是一种错觉?

作者认为,参数空间里的“平坦”不等于函数层面的简单。论文通过对 ReLU 网络重新参数化,展示了原始 Hessian trace 可以变化到 99 倍,而预测结果完全不变。文中提出了一个对重参数化不敏感的指标 weakness,并报告其与留出集准确率存在相关性,而原始曲率指标则没有表现出同样关系。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →