单张 H200 训 20 分钟,GRPO 让 Qwen 3.5-2B 更准更省 token

johnolafenwa · reddit · 2026-09-04

开源模型普遍存在「过度思考」问题。作者(Moses/John Olafenwa)发布 notebook 和视频,从零实现 GRPO 并用它对 Qwen 3.5-2B 做后训练,提升准确率与推理效率。

有趣的发现:训练任务只是「模拟 Python 解释器」,但模型在数学题上也变得更准确、更省 token——泛化效果明显。训练仅约 20 分钟、单张 H200 GPU 完成,代码可套用到任何开源模型。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →