网友用 3 张 V100 自训 80B 模型:SFT 加 GRPO 后训练实践
jjusko20 · reddit · 2026-09-25
作者分享自己 post-train 开源模型 AliceAI-Foundation-80B-A3B-Base 的进行中项目:
- 硬件:3 张 32GB V100,靠 QLoRA 勉强塞下 80B 训练
- 方法:先从 Qwen 3.8 27B 做浅层蒸馏,生成针对长程 agentic 任务的合成数据做 SFT,再用带 grader 模型的 RL/GRPO 继续训练
- 取舍:考虑过用更强模型造数据,但坚持全部流程在本地机器完成
SFT 数据生成框架已搭好,尚无最终结果,属于社区自训前沿开源模型的实践记录。
「编程与Agent」频道最新
- 开发者用 Jev 搭 Agentic Harness,成本与耗时砍约 80% — BLUECOW009 · 2026-09-25
- 基于 Jev 的 Python DSL「vibecheck」发布:四个函数内嵌决策模型 — blaizedsouza · 2026-09-25
- 开发者求证:自建 AI 接入 Meta Messenger 是否合规 — Zilchs · 2026-09-25
- 微软 Foundry 升级:推模型无关 Agent 平台并加入语音智能体 — usamawahabkhan · 2026-09-25
- Claude Managed Agents 解读:托管运行时如何嵌入软件开发生命周期 — blaizedsouza · 2026-09-25
- 一周冲刺换来年省 50 万美元,代价是 100 倍 token 消耗 — hardimanjames · 2026-09-25