PrimeIntellect 推出多智能体强化学习训练栈

shi_weiyan · x · 2026-08-08

PrimeIntellect 宣布将其强化学习(RL)技术栈扩展至多智能体系统,允许开发者表达并训练任意复杂的智能体交互行为。目前,多智能体 RL 支持已正式落地于其 verifiers 和 prime-rl 组件中。

此外,SPIRAL 提出的角色条件优势估计(Role-conditioned Advantage Estimation, RAE)也已被该系统采纳并实现,专门用于支持模型的自博弈(self-play)训练。

所属事件:Prime Intellect 开源多智能体强化学习栈(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →