NVIDIA 推出 Skill2Env:3.4k Agent Skills 转 8k 可执行 RL 环境
burny_tech · x · 2026-09-23
NVIDIA 团队在 alphaXiv 发布论文《Reinforcing Agents with Collective Skills》,提出 Skill2Env——一种面向现代 agentic RL 的人对齐、可扩展数据配方。
- 思路:公开的 Agent Skills(可复用工作流,自带领域专家知识与成功指标)是贴近真实人类任务的监督来源。团队构建流水线,把 3400 个网络爬取并过滤的 Agent Skills 转成 8000 个可在终端独立运行的环境,每个环境带程序化测试与行为 rubric 两种评分方式。
- 效果:仅用 DPPO 变体训练 300 步 RL,Qwen-3.8 27B 在 Terminal-Bench 2.1 提升 4.7 个百分点,在其人工核验的私有基准 S2EBench(真实 agent 用例)提升 4.3 个百分点。
- 分析:模型在类似问题上与原始 Agent Skills 的行为对齐度提高,作者将其与「安全的超级智能需要对齐人类集体价值与专长」的叙事挂钩。
「编程与Agent」频道最新
- 纯 JavaScript 一个 shader 渲染出金色黄昏海崖灯塔 — NathanWilbanks_ · 2026-09-23
- InfoWorld:Agent 记忆必须可审查,否则只是放大幻觉 — rseroter · 2026-09-23
- 网友放出 2.7 万工具的 x402/MPP 目录,不再藏私 — MurrLincoln · 2026-09-23
- 实测 Claude Opus 5.5 一周,六条上手技巧帮你省额度 — every · 2026-09-23
- 知名作者 Burkov 炮轰 OpenCode:「一个巨大的 bug」 — burkov · 2026-09-23
- 开发者入职 Runway 前自制 AI 集训营并公开全部学习资源 — tlakomy · 2026-09-23