深度强化学习圈的黑话:代理损失其实是「假损失」
burkov · x · 2026-08-17
《一百页机器学习》作者 Andriy Burkov 抛出一个实用深度强化学习的「肮脏小秘密」:实际工程中让 PyTorch 优化的那个损失函数并没有物理意义,它只是逆向工程出来的人造结构,好让 PyTorch 把它当成监督学习式的损失去最小化。
所有教材和论文都称之为「代理损失」。他透露写书时本想直接用「假损失」这个词,但怕这种残酷直白会冒犯一些人,最终妥协用了 surrogate loss。
「研究」频道最新
- Apple 发布 LGTM:首个原生 4K 前馈纹理高斯泼溅法 — rsasaki0109 · 2026-08-17
- MobileMem 评估端侧长时记忆能力 — openkg · 2026-08-17
- 字节研究LLM预训练中高质量数据重复策略 — ByteDance-Seed · 2026-08-17
- PRM-as-a-Judge 1.5 评估机器人过程质量 — Yuyang Liu · 2026-08-17
- RealReplicaBench:电商Agent评测全军覆没,最高分仅56.1 — APPSO · 2026-08-17
- RLVR:让 LLM 具备代码与数学能力的底层技术 — burkov · 2026-08-17