Yacine 谈 LLM 强化学习:一切像带着 400 步梯度延迟在训练

cephaloform · x · 2026-09-24

前 xAI 研究员 Yacine 分享他对 LLM 强化学习的一手体感:RL 训练 LLM 时,各种现象表现得像是全程带着约 400 个梯度步的延迟,这个观察引发讨论。

同时他宣布本周将采访 Databricks 的 mrdrozdov,话题涵盖知识型 agent 的 RL 训练、检索的表示学习方案,以及 harness(工具环境)在其中的位置,并向网友征集关于检索的问题。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →