Prime Intellect RL 栈升级:支持多智能体系统训练与评估
willcb · x · 2026-09-29
Prime Intellect 宣布其开源 RL 训练栈 PRIME-RL 从单个智能体扩展到多智能体系统训练,可编程任意智能体间交互、选择哪些角色学习、并在完整交互链路上分配 credit。
- 基于 verifiers v1 与 prime-rl 的算法层两大抽象:Agent(封装 Taskset/Harness/Runtime,核心签名 Agent.run(task) -> Trace)与 Env
- 可表达的新交互模式:Agentic Judging(评判者给 solver 轨迹打分)、Self-Play(自对弈)、User-Sim(用户智能体与助手交互)
- 作者 Vincent Weisser 的路线主张:超智能将来自「数万亿自我改进的智能体」而非单一神级模型,配套方向包括自主 AI 研究(数据到前后训练)、递归自改进 agent harness 与持续学习
这是 agentic RL 基础设施的一次实质性扩展,开源可复用。
「编程与Agent」频道最新
- 官方选型建议:大项目用 Opus,Sonnet 拉满不如换 Opus — ClaudeDevs · 2026-09-29
- HeyGen 接入 Jev:毫秒级筛线索,几分钱成本决定谁配得上一条定制视频 — HeyGen · 2026-09-29
- 一条 ffmpeg 命令可视化视频中的运动:tblend 差分找出蜂群 — johnowhitaker · 2026-09-29
- Cline 桌面版发布后登 OpenRouter 热榜,升至第二大编码 Agent — cpaik · 2026-09-29
- Claude Code v2.1.284:接入 Sonnet 5.5,新增用量美元显示与 MCP 批量重连 — ashwin-ant · 2026-09-29
- 零代码写出 23 万行 AI 应用,作者公开上线前六步生产清单 — PawelHuryn · 2026-09-29