推测 RL 部署慢影响模型推理速度

kalomaze · x · 2026-08-18

作者推测模型推理生成速度慢可能与 RL(强化学习)训练时的 wall clock time 有关。如果 RL 训练中单个 rollout 较慢但总吞吐量尚可,模型可能会在部署时“内化”这种生成速度,相对真实世界的沙箱执行显得较慢。

所属事件:LLM如何感知时间?或源于模糊插值启发式算法(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →