Qwen MoE 稳定性论文:训练与推理 KL 散度随步数上升
heghbalz · x · 2026-07-24
- 这条帖子转向了 Qwen MoE 稳定性论文,重点是图里的 training-inference KL divergence。
- 发帖人想弄清:为什么训练阶段的策略与推理阶段之间的 KL 散度会随着时间上升,而且这些实验还是 同步训练,并非异步或 off-policy 造成。
- 配图展示了不同实验在梯度步数上 KL divergence 的变化,其中有一条曲线在早期迅速发散。
「研究」频道最新
- AI研究员:递归自我提升受限于全行业数据瓶颈 — herbiebradley · 2026-07-24
- 论文给出参数模型 Fisher-Rao 距离的可界近似方法 — FrnkNlsn · 2026-07-24
- 一句“lol Grok”带出 RL 是否让模型产生真实目标的争论 — Sauers_ · 2026-07-24
- Science 新刊聚焦 4D nucleome,多篇单细胞 3D 基因组论文同刊 — jmuiuc · 2026-07-24
- CogSci 2026 语言建模最佳论文奖颁给这篇论文 — gregd_nlp · 2026-07-24
- Proba 要先预测微调数据如何改变开权重模型 — markjeffrey · 2026-07-24