STACX: 端到端智能体强化学习模块化基础设施
daibond_alpha · x · 2026-08-12
STACX 是一个用于智能体训练、评估和强化学习的模块化开源框架。它构建了一个完整的闭环:将基准测试任务交给在真实沙盒容器中运行的智能体,由验证器对结果进行评分,最后将轨迹数据传回训练器。
主要特性:
- 训练与评估:支持 GRPO、SFT、DAgger 等多种训练配方,兼容 OpenHands 等现有框架及自研智能体。
- 多基准支持:可在 SWE-bench、Terminal-Bench、KernelBench 等多种环境中运行。
- 架构设计:通过整合沙盒引擎、环境引擎和强化学习引擎,解决不同智能体、环境和算法间的异构性问题,提升 LLM 预训练与智能体研究的效率。
「编程与Agent」频道最新
- 开发者实测:让AI修Bug,它竟自曝只有50%把握 — _jaydeepkarale · 2026-08-12
- 探讨基于 Claude Code 等工具开发插件的商业模式 — doooyle · 2026-08-12
- 构建本地极简Agent工作流:SearxNG搜索与推理预算控制实践 — use_your_imagination · 2026-08-12
- Sequoia 分享 Harvey AI 实战:低成本打造研究级法律智能体 — Scobleizer · 2026-08-12
- MiniMax H3 视频生成工作流:基于参考图重写提示词 — Askdevin777 · 2026-08-12
- DSPy 衍生项目 DSRs 突破 300 Star,开发者分享架构演进思考 — krypticmouse · 2026-08-12