LEGO-RL 发布:让编码 agent 用原生 harness 直接做策略梯度训练

Lego-X · hf · 2026-08-20

LEGO-RL 是一个面向编码智能体的强化学习框架,核心思路是把「原生编码 agent harness」直接接入可扩展的策略梯度训练,而不必为训练重写一套执行环境。

技术路线包括三部分:

作者报告该框架在多个 harness 上提升了稀疏 MoE 模型的表现。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →