步态训练技巧:用滚动平均速度奖励避免振荡
yacineMTB · x · 2026-09-01
开发者在强化学习训练中发现,直接追踪当前步速度的奖励会导致模型出现步态振荡(shuffle)。改为基于更长时间窗口的滚动平均速度计算奖励后,新策略表现显著优于之前的 pollen trainer。
「研究」频道最新
- Dan Luu 深度解析:软件变慢是选择而非必然 — JeremyCMorgan · 2026-09-01
- 学者吐槽 LLM 糟糕写作:审稿与回复已成文字垃圾场 — thegautamkamath · 2026-09-01
- 论文解析:DeepSeek R1 等推理模型如何进行思维链推理 — rao2z · 2026-09-01
- Qdrant 9月17日线上研究分享:token 原生存储可提速百倍 — qdrant_engine · 2026-09-01
- Nature 论文:用角色扮演框架解析 LLM 行为 — mpshanahan · 2026-09-01
- AI Agent 优化压力或致古德哈特定律失效 — dhadfieldmenell · 2026-09-01