Reddit 网友用 3 张 V100 从零后训练 80B MoE 模型,已迭代到第 5 期
jjusko20 · reddit · 2026-10-06
Reddit r/LocalLLaMA 用户 jjusko20 更新其开源后训练项目第 5 期:对 yandex/AliceAI-80B-A3B-Base 做 instruct 微调,目标是让模型具备 agentic 工作与对话能力。
关键细节:
- 训练资源:全部在本地 3 张 32GB V100 上完成,训练数据也由同一组卡通过 sftmill 本地合成
- 方法:用 Qwen 3.8 27B 做 shallow distill(中等深度),给模型注入 chain-of-thought 推理与对话能力
- 本轮改进:新增合成约 500 万 token 的 SFT 数据,使用更大的通用 instruct 轨迹来缓解此前的 underfitting,学习率较原 LoRA 适配器降低约 4 倍
- 直播训练:作者在 Cloudflare 隧道上直播训练过程,单轮预计 12-14 小时,不够则再跑一个 epoch
对想低成本本地微调大模型的开发者是难得的一手实践记录。
「模型」频道最新
- Anthropic 分词器效率偏低,直接比 token 数的算账不靠谱 — JoshPurtell · 2026-10-06
- 有人算账了:Codex 订阅可能靠 API 收入隐性补贴 — JoshPurtell · 2026-10-06
- Reflection 发 Beam 号称西方开源前沿,关键编码测试仍落后 Qwen、DeepSeek — TheTuringPost · 2026-10-06
- Reflection 发布 5010 亿参数开放权重模型 Beam — BVCC6FNTKX · 2026-10-06
- Reflection 发布美国最强开源模型,社区称达 SoTA 水平 — bigblueboo · 2026-10-06
- 实测对比:开源新模型 Beam 不敌 DeepSeek Flash — bindureddy · 2026-10-06