VHD-Play:每个几美分批量生成智能体 RL 训练环境
Xinjie Shen · hf · 2026-09-24
VHD-Play 提出反转现有环境生成流程的思路:先采样并求解一个数学模型,再由语料锚定的 setter 将其决策过程渲染成有状态工具,可执行动力学与轨迹评分参考直接继承自同一解出的模型,避免了环境与评估规则事后对齐的常见问题。
- 以每个几美分的成本生成 3300 个多样的智能体环境
- 在三个环境家族上训练 Qwen3.6-35B-A3B,五家族诊断集平均分从 0.204 升至 0.815
- 泛化到三个训练家族的 held-out 实例、八个未见机制家族,并迁移到函数调用、旅行规划、电商等外部基准
- E-Commerce Bench 上训练后模型全程未破产,超过 Qwen3.7-Max
- 对比显示大部分可学习差距在有状态交互而非底层问题求解;冻结 35B setter 可扩展环境规模
「编程与Agent」频道最新
- 用一段 Hermes Agent 提示词让 Claude 自审记忆文件防膨胀 — alexcovo_eth · 2026-09-24
- 开源 MCP 服务器打通 Claude 与 ComfyUI,50+ 工具免拖节点 — Less_Actuary_9441 · 2026-09-24
- 用 Notion 做数据中枢:AI 服务随时换、数据不搬家 — ivanhzhao · 2026-09-24
- 开发者激辩:会用编程 Agent 的 22 岁胜过守旧资深工程师 — jobergum · 2026-09-24
- Blender MCP 星标 2.9 万,Opus 5.5 中档力度即可建城 — sidahuj · 2026-09-24
- AI 蜂群两周逆向 2001 年 GBA 游戏,逐字节完全复刻 ROM — Aizkmusic · 2026-09-24