推测 RL 部署慢影响模型推理速度
kalomaze · x · 2026-08-18
作者推测模型推理生成速度慢可能与 RL(强化学习)训练时的 wall clock time 有关。如果 RL 训练中单个 rollout 较慢但总吞吐量尚可,模型可能会在部署时“内化”这种生成速度,相对真实世界的沙箱执行显得较慢。
所属事件:LLM如何感知时间?或源于模糊插值启发式算法(3 条相关)→
「研究」频道最新
- 训练模型不检查数据?那是模型在训练你 — kalomaze · 2026-08-18
- 研究发现 28 万仓库含 380 万个 Agent 技能文件 — dair_ai · 2026-08-18
- 300 页专著:评估与操作可靠编码 Agent 的系统工程 — heyneighbor · 2026-08-18
- 清华字节开源CUDA Agent:强化学习写CUDA超越人类专家 — anselm · 2026-08-18
- Jason Wei 参与论文探讨“机器学习”定义与智能体新范式 — lateinteraction · 2026-08-18
- 探讨 LLM 推理与知识的解耦:计算浪费论引发的反思 — lateinteraction · 2026-08-18