Apple 研究:让 MoE 路由对齐 agent 操作,长程任务成功率提升超 10 点
apple · hf · 2026-10-08
Apple 团队系统研究 agent 后训练与 MoE 专家选择结构的关系:
- 观察:现成 MoE 模型的专家选择天然带有与 agent 轨迹对齐的专用结构——agent 执行语义相似操作(如 READ、UPDATE)的轮次间,专家路由重叠度更高。
- 问题:标准 RL 算法无视这种专门化,训练时路由不受控,限制任务表现与推理效率。
- 方法:提出层次化路由控制框架,在 turn 级鼓励专家选择与 agent 操作对齐,在 token 级正则化路由保持局部一致性;并引入熵门控机制解决后训练不稳定。
- 结果:在所有评测 benchmark 上成功率提升超 10 个百分点,证明 agent 轨迹结构是优化 MoE 容量的有效信号。
「编程与Agent」频道最新
- Gremlin 发布 Foresight AI:用 Agent 提前发现并修复系统故障 — dauber · 2026-10-08
- Anthropic 发布 Agent 隔离最佳实践:微VM 沙箱加沙箱逃逸分类器 — chrisrohlf · 2026-10-08
- 开发圈争论:编排 20+ 个 Agent 真比手动管 3-5 个高效吗 — granawkins · 2026-10-08
- 应用层 AI 公司都在重造 Agent 栈,作者主张改做 Claude 原生应用 — matt_slotnick · 2026-10-08
- O'Reilly 免费直播:10 月 13 日聚焦 AI Agent 记忆架构实战 — TheTuringPost · 2026-10-08
- 开源 AI Agent Cindy 发布:一端集成 Claude Code、Codex 与 Pi — vista8 · 2026-10-08