Qwen学会了训练Qwen

DanAiTuning · reddit · 2026-07-14

作者表示,他把 Qwen3.6-35B-A3B 训练成了一个“会用 RL 训练别的模型”的模型:它接到任务后,会自己写完整训练作业,包括环境、奖励、数据集和超参,然后提交到真实 GPU 上执行。

训练方式

结果

作者把仓库、任务族、奖励代码、GPU 调度和复盘都开源了。

所属事件:开发者用RL训练Qwen实现AI自主训练AI(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →