ICML讨论结果型RL能否带来新推理
Vector研究所研究员在ICML 2026围绕强化学习能否让模型获得全新推理能力展开讨论。相关工作指出,基于结果的RL后训练受“似然分位数”约束,难以突破基础模型已掌握的知识,更像是在挖掘而非创造能力。
2026-07-08 ~ 2026-07-08 · 2 条相关
- Vector研究所ICML 2026探讨:强化学习能否教会AI新推理能力 — VectorInst · 2026-07-08
- 研究证明结果型RL受限于基础模型 — VectorInst · 2026-07-08