零 SFT 直接 RL:用 0.8B Qwen 基座跑 GRPO 数小时就能看会推理

alexcovo_eth · x · 2026-09-06

一条可照做的强化学习入门项目配方:

作者称这是展示 RL 能力的最佳练手项目,配套的是 Hugging Face 模型库。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →