新论文修补对比强化学习盲区:用1比特失败信号重加权InfoNCE
kastnerkyle · x · 2026-09-06
一篇被推荐的对比强化学习(CRL)新论文指出了一个长期被忽视的盲点:InfoNCE 只从存活步骤采样正样本对,完全忽略了失败终止带来的缺失概率质量,导致 critic 在死亡陷阱附近过度乐观,诱使 agent 在临死前做出鲁莽动作。
- 作者没有采用杂乱的安全奖励 hack,而是利用基础的 1 比特失败信号对 InfoNCE 重加权,把存活概率质量折回策略更新
- 在全部 12 个任务基准上,简单 Point/Car 环境下与基线相近,但一旦加入危险区,Ant 和 Humanoid pitfall 任务上差距巨大
转发者认为这解决了困扰许多研究者的对比 RL 难题。
「研究」频道最新
- arXiv 论文:单一指标评估 LLM 鲁棒性会误导,需多层级分析 — burny_tech · 2026-09-06
- Prove2Me 走红:支撑 Anthropic 形式化费马大定理的众包平台 — burny_tech · 2026-09-06
- 因果基础模型来了:预训练一次,上下文学习估算因果效应 — burny_tech · 2026-09-06
- Google 发布迄今最大细胞级脑图谱:果蝇 16.6 万神经元全连接 — udmrzn · 2026-09-06
- Unreal Engine 流水线产出 8700+ 小时动作条件视频预训练世界模型 — udmrzn · 2026-09-06
- GPT-6 Astra 评测风波:闭源榜单差异只是测量噪声 — PerformanceRound7913 · 2026-09-06