Yacine 谈 LLM 强化学习:一切像带着 400 步梯度延迟在训练
cephaloform · x · 2026-09-24
前 xAI 研究员 Yacine 分享他对 LLM 强化学习的一手体感:RL 训练 LLM 时,各种现象表现得像是全程带着约 400 个梯度步的延迟,这个观察引发讨论。
同时他宣布本周将采访 Databricks 的 mrdrozdov,话题涵盖知识型 agent 的 RL 训练、检索的表示学习方案,以及 harness(工具环境)在其中的位置,并向网友征集关于检索的问题。
「编程与Agent」频道最新
- Agentic Optimisation:agent 时代视觉能力的本质变化是什么 — _krishna_murthy · 2026-09-24
- 开发者用 Codex 把 3D 扫描劈柴机做成原生 iOS 游戏 — OpenAIDevs · 2026-09-24
- 韩国开发者警示:非程序员用 AI 开发,最易忽视不可见的部分 — algo_diver · 2026-09-24
- Agent 一句话犯 12 项合规违规,Anchor 3.0 实时拦截改写 — Saboo_Shubham_ · 2026-09-24
- Claude 拒做的步骤 Codex 两度搞定,安全护栏成落地痛点 — ChanceKelch · 2026-09-24
- 语音 Agent 硬伤:分不清房间里谁在说话 — Div_pradeep · 2026-09-24