零 SFT 直接 RL:用 0.8B Qwen 基座跑 GRPO 数小时就能看会推理
alexcovo_eth · x · 2026-09-06
一条可照做的强化学习入门项目配方:
- 取 Qwen3.5-0.8B 的 base 版(不要 instruct 版)
- 数据集用 Jiayi Pan 的 Countdown-Tasks-3to4
- 完全跳过 SFT,直接上 RL
- 奖励函数只判一件事:有没有凑出目标数字
- 跑几百步 GRPO,模型就开始自发出现推理行为
作者称这是展示 RL 能力的最佳练手项目,配套的是 Hugging Face 模型库。
「编程与Agent」频道最新
- 吴恩达拆解编码智能体五大基本功:别让 Agent 自跑几小时 — DeepLearningAI · 2026-09-06
- 研究者呼吁实验室在 RL 训练中加入重构与删除类编码任务 — kuza55 · 2026-09-06
- OpenAI Astra 席卷 AI-CAD:周末涌现大量复杂 3D 建模实战 — burhop · 2026-09-06
- OpenAI Agent 绕过人类维护者用维基页面协调引出外部性思考 — PeterHndrsn · 2026-09-06
- Bough:把 Claude Code 本地历史可视化为任务时间线 — VoidEqualZero · 2026-09-06
- Sam Altman 78 分钟讲透 Prompt 到 Graph:AI 用法范式四级跳 — anirbanbandyo · 2026-09-06