深度强化学习圈的黑话:代理损失其实是「假损失」

burkov · x · 2026-08-17

《一百页机器学习》作者 Andriy Burkov 抛出一个实用深度强化学习的「肮脏小秘密」:实际工程中让 PyTorch 优化的那个损失函数并没有物理意义,它只是逆向工程出来的人造结构,好让 PyTorch 把它当成监督学习式的损失去最小化。

所有教材和论文都称之为「代理损失」。他透露写书时本想直接用「假损失」这个词,但怕这种残酷直白会冒犯一些人,最终妥协用了 surrogate loss。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →