用RL训练Qwen去训练其他AI模型
DanAiTuning · reddit · 2026-07-15
开发者成功使用强化学习训练了一个能自主训练其他 AI 模型的智能体,并开源了全部代码。 - **核心机制**:基于 Qwen3.6-35B-A3B 构建训练器智能体,它能编写完整的训练任务(含环境、奖励、数据集和超参),并调度真实 GPU 执行。当内部模型在隐藏评测中得分提升时,智能体获得奖励,形成“RL 套娃”循环。 - **关键结果**:经过约 54 步外循环(背后约 1750 个真实 GPU 训练任务),奖励得分从 0 升至 0.63 峰值;技能成功泛化至未见过的新任务;智能体学会了优先选择 1.7B 而非 0.6B 基座模型,并更积极地使用超参配置。 - **成本与细节**:整个实验总成本约 1300 美元,单次内部训练成本仅 0.13-0.30 美元。学习过程分两步:先学会“不崩溃”,再学会“训出更好的模型”。 - **开源内容**:GitHub 仓库包含完整框架、任务族、奖励代码、GPU 编排脚本及失败案例复盘。
所属事件:开发者用RL训练Qwen实现AI自主训练AI(2 条相关)→
「编程与Agent」频道最新
- Apple 提出无需真实环境的 API 智能体合成数据方法 — _akhaliq · 2026-07-21
- MIT 博士生称递归语言模型或重塑编码智能体设计 — ctjlewis · 2026-07-21
- Reddit 用户设计四层本地 AI 机房:vLLM 到 OPNsense 全分层 — povedaaqui · 2026-07-21
- 开发者把 Cursor、Claude 等多个 agent 放进 Replit 同一代码库 — amasad · 2026-07-21
- Antigravity CLI 1.1.5 支持会话中调节 effort 和固定模型 — rseroter · 2026-07-21
- 有人开始用 Claude Code 自建小应用替代现成工具 — alexmacgregor__ · 2026-07-21