River API 测试胜出,实现大 MoE 零训练推理偏差
marcbhargava · x · 2026-08-18
- 核心成果:River API 在强化学习任务中表现优于 Tinker,使用相同的训练代码但结果更优。
- 解决的问题:实现了大模型 MoE(Mixture of Experts)架构的 0 训练-推理偏差(train-infer mismatch)。
- 技术细节:团队投入大量精力优化了路由重放等细节,确保 API 发挥最佳性能。
- 开源验证:相关实验已在 Qwen3.6-35B-A3B 模型上进行 Wordle 游戏教学测试,并进行了多项消融实验,代码全开源。
所属事件:TogetherAI 开源 XoRL,实现 MoE 模型 RL 零训练推理偏差(4 条相关)→
「研究」频道最新
- 开发者提出混合注意力新架构:基于质心聚类的token级路由 — InfamousTrouble7993 · 2026-08-18
- 模型感知时间可能是模糊插值启发法 — kalomaze · 2026-08-18
- 推测 RL 部署慢影响模型推理速度 — kalomaze · 2026-08-18
- 字节新论文:测试 AI Agent 是否真的听话 — rohanpaul_ai · 2026-08-18
- 优化器改变模型容量?谱缩放定律揭示 AdamW 弱于 Muon — YouJiacheng · 2026-08-18
- 深度评价 DeepSeek 架构:被低估的愿景级软件 — aiamblichus · 2026-08-18