研究称现实延迟成强化学习新瓶颈,将转向世界模型

最新研究指出,随着推理成本急剧下降(如 Cerebras 等方案),强化学习的瓶颈正从计算能力转向环境交互的物理等待——现实世界中等待人类响应或内部训练运行等状态转移在时间上不可压缩。这种延迟差距将成为关键制约,意味着在大规模训练场景下,最优策略可能不得不从真实环境交互转向基于世界模型的模拟训练。

2026-08-24 ~ 2026-08-24 · 2 条相关